模型發布
Kimi K3多試反超Fable 5
Together AI
Together AI 的 DeepSWE 評測顯示,Kimi K3 的 pass@1 為 68.5%,略低於 Claude Fable 5 的 69.9%,但 pass@2 與 pass@4 分別以 82.0% 對 80.2%、89.4% 對 88.5% 反超。Kimi K3 每次 rollout 成本為 4.65 美元,低於 Fable xhigh 的 13.41 美元,每美元可解任務量為 2.8 倍,開放權重也讓團隊能掌握部署。不過 Claude Fable 5 四次皆成功的任務較多(58 對 45),且 Kimi K3 耗時更長;兩者成敗高度相似,搭配使用帶來的多樣性有限。
讀原始報導背景
DeepSWE 是一套包含 113 項原創長時程軟體工程任務的基準測試,用來評估程式開發代理在接近真實工作情境下的表現。其任務從零撰寫,而非改編自既有提交或拉取請求,以避免模型在預訓練期間看過解答;測試內容涵蓋理解精簡需求、檢查陌生程式碼庫、完成修改並維持既有行為。