研究與評測
微軟作者公開 ThinkingBox:507 項代理工作流中,Kimi-K3 僅 13.41% 20 次全成
Reddit r/MachineLearning單一來源
核實資料不足
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
本次未取得足夠原文證據
這項消息來自 Reddit r/MachineLearning 貼文,信心等級為 unverified,且沒有其他佐證來源;以下數字都是貼文對 ThinkingBox 論文、程式碼與資料集的自述,尚未經獨立驗證。貼文作者表示自己是微軟成員,團隊公開了 ThinkingBox 基準測試,並在 Hugging Face OpenEnv 提供環境;原始評測軌跡未公開。
ThinkingBox-Bench 包含 507 項政策約束的企業工作流,涵蓋零售、旅遊與旅宿、汽車保險、數位銀行內部 IT,以及顧問業 IT/人資等 5 個領域。每項任務以相同的乾淨後端獨立執行 20 次,共 10,140 場試驗;模擬使用者持有私人脈絡,只有在代理詢問時才提供。評分比較終端後端狀態與副作用是否符合要求,錯誤、遺漏或多出的效果都算失敗;其中 477 項只依狀態評分,另有 30 項會檢查最終回應的一項特定條件。
基準區分三項指標:pass@1 是所有嘗試中成功的比例;pass@20 是 20 次中至少成功一次的任務比例;all-20 則是 20 次全部成功的任務比例。貼文稱,Kimi-K3 至少解出一次的任務最多,為 93.89%(476/507),但 20 次全部成功僅 13.41%(68/507);Claude Opus 5 至少成功一次為 79.09%,但 all-20 達 47.53%(241 項)。Qwen3.8-27B 的兩項數字則為 89.35% 與 7.50%。作者據此指出,依 pass@20 與依 all-20 排出的模型名次可能幾乎相反。
另一項涵蓋 12 個模型、121,680 場有效試驗的回溯消融分析中,有 79,853 場未通過可執行檢查;其中 67.24% 仍正常結束、呼叫過會改變狀態的工具,且沒有出現最終工具錯誤,因此若只用「完成」類代理指標,可能會被判為成功。在這些正常結束但失敗的試驗中,狀態檢查發現錯誤欄位值占 77.61%、非預期額外效果占 43.30%、缺少必要效果占 25.36%;分類可重疊,且是診斷標籤,不代表因果解釋。
貼文也提醒,這些任務是企業工作流模式的合成重建,不是生產環境流量;all-20 是固定 20 次試驗中觀察到的計數,不保證未來可靠度;模擬使用者固定由一個 LLM 扮演,可能引入變異。ThinkingBox 的 507 項任務可透過 Hugging Face OpenEnv 對其他模型測試,附錄另報告 plug-in pass-k 估計值,但該估計與固定 20 次觀察結果回答的是不同問題。
讀原始報導