研究與評測
微軟與 Hugging Face 發布 AI Agent 評測基準 ThinkingBox:以資料庫真實狀態為準,Claude Opus 5.5 奪冠
HuggingFace Blog一手來源
已查原文 · 4 項主張
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
經查證,報導中提及的 ThinkingBox 評測基準確實存在。原文證實了基準包含507個工作流程,並記錄到高達79,853次表面看似正常卻未通過檢查的失敗試驗。此外,各模型的勝率排行(Claude Opus 5.5 奪冠、Kimi-K3 為最強開源模型)以及特定模型在零售與車險領域的極大表現差異等核心主張,皆與原文數據完全吻合。
單次嘗試成功率中,Claude Opus 5.5 領先,Kimi-K3 則是開源模型之冠。
排行榜中確實由 Claude Opus 5.5 領先,且 Kimi-K3 為最強的開源模型。
Claude Opus 5.5 leads
查看原始出處
Kimi-K3 is the strongest
查看原始出處
模型表現受領域影響,如在零售領域達 68.62%,但在車險領域僅 8.30%。
原文舉例同一模型在零售與車險領域的成功率落差極大,數據完全一致。
68.62% on retail but 8.30%
查看原始出處

微軟與 Hugging Face 聯合發布 AI Agent 評測基準 ThinkingBox。該基準旨在解決 AI Agent 表面上成功呼叫工具並回報任務完成,但實際資料庫狀態卻錯誤的問題。ThinkingBox 透過檢查終端後端狀態與副作用進行評分,共涵蓋 507 個狀態化業務工作流程,每個任務在各模型上重複執行 20 次以驗證可靠性。
實測數據顯示,在 12 款 LLM 的 121,680 次有效試驗中,共有 79,853 次未能通過可執行檢查。在這些失敗案例中,高達 67.24% 正常終止、呼叫了狀態變更工具且未產生報錯;然而進一步檢查發現,77.61% 留下錯誤的欄位值,43.30% 產生意外的副作用,25.36% 遺漏了必要效果。
在單次嘗試成功率(pass@1)排行榜中,Claude Opus 5.5 以 67.16% 領先,其次為 Claude Opus 5(66.50%)與 GPT-5.4(65.36%)。開源模型方面,Kimi-K3 以 57.37% 居冠,表現逼近 GPT-6 Astra(58.31%)。
評測也顯示模型表現受領域影響極大,例如 Claude Opus 4.6 在零售領域成功率達 68.62%,但在汽車保險領域僅有 8.30%。
讀原始報導背景
在評估 AI 代理(AI agents)時,傳統方法通常僅檢查其工具呼叫(tool calls)或最終回覆是否正確。然而,代理在處理複雜的企業工作流程時,經常發生回覆看似成功,但實際資料庫狀態卻未正確更新的落差。為了解決此問題,微軟與 Hugging Face 共同推出了「ThinkingBox」基準測試,直接檢驗代理執行後留下的終端後端狀態與副作用。