模型發布
Cognition 發布 SWE-2 程式碼模型:基於 2.8T 參數 Kimi K3 訓練,FrontierCode 跑分達 50%
Hacker News單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

Cognition 宣布推出最新程式碼模型 SWE-2,即日起於 Devin Desktop 與 CLI 上線,並將陸續部署至 Devin Web 與 Fusion。
SWE-2 基於 2.8 兆參數的 Kimi K3 模型進行後訓練(post-training)。官方表示,透過將強化學習(RL)擴展至兆級參數規模,並採用在單次運行中訓練所有推理層級的 RL 演算法,模型在多項基準測試中較基礎模型提升 5 至 6 分。
在 FrontierCode 1.1 Main 測試中,SWE-2 取得 50.0% 的成績,超越 Grok 4.6(48.0%)與 GPT-5.6 Sol(47.5%),逼近 Fable 5.1(50.9%)但成本降低 64%,並以四分之一的成本接近 GPT-6 Astra(53.3%)。在 DeepSWE 1.1 中,SWE-2 獲得 73.0%;但在 Terminal-Bench 4 中僅獲 27.3%,落後於 Fable 5.1(55.8%)與 GPT-6 Astra(57.9%)。
技術與訓練方面,SWE-2 引入依據推理層級的線性成本懲罰機制,並透過 NVFP4/FP8 核心與量化感知訓練降低記憶體使用量,在基礎模型參數達前代 3 倍的情況下維持相近的吞吐量。此外,團隊將 RL 環境數量增加三倍,並加入指令跟隨覆蓋層。
在行為表現上,SWE-2 改善了前代過度探索的問題。在 FrontierCode 1.1 Main 中,SWE-2 medium 的平均對話輪數較前代 SWE-1.7 減少 58%,成本降低 81%,且首次實際編輯程式碼的中位數步數從 48 步大幅縮短至 18 步。官方亦指出其具備更佳的測試覆蓋率與資源運用能力,例如在缺乏 MCP 整合時,能主動從 Slack 歷史紀錄中重建資料。
讀原始報導社群討論
社群對 SWE-2 普遍抱持懷疑,指出其在舊版 Terminal Bench 2.1 獲 92.8% 高分,但在新版 Terminal Bench 4 卻暴跌至 27.3%,質疑其過度針對跑分最佳化(benchmaxxed)。儘管有人讚賞其基於 Kimi K3 微調後展現的 token 效率,但多數用戶不滿該模型缺乏開源權重且須綁定 Devin 平台。許多開發者表示,他們更傾向使用 DeepSeek Flash 4.1 等掌控度高的模型,或需要能處理跨領域任務的通用型 AI。