模型發布
Kimi K3登Agent Arena第4
X @arena
Kimi K3 在逾 8,000 場真實代理任務中登上 Agent Arena 第 4 名,追平 Claude Opus 4.8 與 GPT-5.6 Sol,並在確認任務成功率排名第 1。相較 Kimi K2.7 Code 的第 23 名,其代理效能明顯躍升,但可操控性與 Bash 錯誤恢復能力僅分列第 14 與第 17。若完整權重如期於 7 月 27 日前釋出,Kimi K3 將成為榜上排名最高的開放權重模型。
讀原始報導背景
Agent Arena 是一個動態排行榜,依據工具可靠性、任務完成度與可操控性等訊號,評估模型協調工具處理真實世界代理任務的表現。新聞提到的因果追蹤(causal tracing)是一種利用統計與演算法技術重建系統因果路徑的方法。