跳到主要內容
2026-07-24 日報
模型發布

Kimi K3多試反超Fable 5

Together AI
Together AI 的 DeepSWE 評測顯示,Kimi K3 的 pass@1 為 68.5%,略低於 Claude Fable 5 的 69.9%,但 pass@2 與 pass@4 分別以 82.0% 對 80.2%、89.4% 對 88.5% 反超。Kimi K3 每次 rollout 成本為 4.65 美元,低於 Fable xhigh 的 13.41 美元,每美元可解任務量為 2.8 倍,開放權重也讓團隊能掌握部署。不過 Claude Fable 5 四次皆成功的任務較多(58 對 45),且 Kimi K3 耗時更長;兩者成敗高度相似,搭配使用帶來的多樣性有限。
讀原始報導

背景

DeepSWE 是一套包含 113 項原創長時程軟體工程任務的基準測試,用來評估程式開發代理在接近真實工作情境下的表現。其任務從零撰寫,而非改編自既有提交或拉取請求,以避免模型在預訓練期間看過解答;測試內容涵蓋理解精簡需求、檢查陌生程式碼庫、完成修改並維持既有行為。

這則事件的發展

  1. 2026-07-22Moonshot AI 推出 Kimi K3
  2. 2026-07-21Kimi K3代理工作評測居次
  3. 2026-07-21Kimi K3需求爆量暫停訂閱
  4. 2026-07-20Kimi K3登Agent Arena第4
  5. 2026-07-20Kimi K3據報將開放權重

來源