跳到主要內容
2026-07-21 日報
模型發布

Kimi K3代理工作評測居次

X @ArtificialAnlys
上週發布的 2.8T 參數模型 Kimi K3,在 Artificial Analysis Intelligence Index 獲得 57 分,並於代理知識工作基準 AA-Briefcase 取得 1543 Elo,僅次於 Claude Fable 5 的 1574。相較 Kimi K2.6 的 816,Kimi K3 提升 727 分,分析品質表現突出,但簡報呈現品質相對較弱。其每項任務平均成本為 10.57 美元、耗時 56.4 分鐘,且執行成本高於 Claude Opus 4.8,顯示效能伴隨明顯的成本與延遲限制。
讀原始報導

背景

AA-Briefcase 是由 Artificial Analysis 開發的代理式知識工作基準測試,用來比較 AI 模型處理這類任務時的效能;相關評估亦會觀察速度與成本。Artificial Analysis Intelligence Index v4.1 則整合 GDPval-AA v2、Terminal-Bench v2.1、SciCode 等 9 項評估。

這則事件的發展

  1. 2026-07-19Kimi K3發布震撼AI與晶片股
  2. 2026-07-18月之暗面推出開源 Kimi K3
  3. 2026-07-18Kimi-K3登頂前端程式評測
  4. 2026-07-17Kimi K3推出百萬上下文模型
  5. 2026-07-17Kimi K3 智慧指數得分 57

來源