跳到主要內容
2026-10-04 日報
研究與評測

微軟與 Hugging Face 發布 AI Agent 評測基準 ThinkingBox:以資料庫真實狀態為準,Claude Opus 5.5 奪冠

HuggingFace Blog一手來源
已查原文 · 4 項主張

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

經查證,報導中提及的 ThinkingBox 評測基準確實存在。原文證實了基準包含507個工作流程,並記錄到高達79,853次表面看似正常卻未通過檢查的失敗試驗。此外,各模型的勝率排行(Claude Opus 5.5 奪冠、Kimi-K3 為最強開源模型)以及特定模型在零售與車險領域的極大表現差異等核心主張,皆與原文數據完全吻合。

基準涵蓋 507 個狀態化業務工作流程。

原文明確指出該基準使用了507個狀態化業務流程。

507 stateful business workflows

查看原始出處

12 款 LLM 試驗中,共有 79,853 次未通過檢查。

原文數據證實有79,853次嘗試未能通過執行檢查。

79,853 attempts failed

查看原始出處

單次嘗試成功率中,Claude Opus 5.5 領先,Kimi-K3 則是開源模型之冠。

排行榜中確實由 Claude Opus 5.5 領先,且 Kimi-K3 為最強的開源模型。

Claude Opus 5.5 leads

查看原始出處

Kimi-K3 is the strongest

查看原始出處

模型表現受領域影響,如在零售領域達 68.62%,但在車險領域僅 8.30%。

原文舉例同一模型在零售與車險領域的成功率落差極大,數據完全一致。

68.62% on retail but 8.30%

查看原始出處
微軟與 Hugging Face 聯合發布 AI Agent 評測基準 ThinkingBox。該基準旨在解決 AI Agent 表面上成功呼叫工具並回報任務完成,但實際資料庫狀態卻錯誤的問題。ThinkingBox 透過檢查終端後端狀態與副作用進行評分,共涵蓋 507 個狀態化業務工作流程,每個任務在各模型上重複執行 20 次以驗證可靠性。 實測數據顯示,在 12 款 LLM 的 121,680 次有效試驗中,共有 79,853 次未能通過可執行檢查。在這些失敗案例中,高達 67.24% 正常終止、呼叫了狀態變更工具且未產生報錯;然而進一步檢查發現,77.61% 留下錯誤的欄位值,43.30% 產生意外的副作用,25.36% 遺漏了必要效果。 在單次嘗試成功率(pass@1)排行榜中,Claude Opus 5.5 以 67.16% 領先,其次為 Claude Opus 5(66.50%)與 GPT-5.4(65.36%)。開源模型方面,Kimi-K3 以 57.37% 居冠,表現逼近 GPT-6 Astra(58.31%)。 評測也顯示模型表現受領域影響極大,例如 Claude Opus 4.6 在零售領域成功率達 68.62%,但在汽車保險領域僅有 8.30%。
讀原始報導

背景

在評估 AI 代理(AI agents)時,傳統方法通常僅檢查其工具呼叫(tool calls)或最終回覆是否正確。然而,代理在處理複雜的企業工作流程時,經常發生回覆看似成功,但實際資料庫狀態卻未正確更新的落差。為了解決此問題,微軟與 Hugging Face 共同推出了「ThinkingBox」基準測試,直接檢驗代理執行後留下的終端後端狀態與副作用。

本期分類