跳到主要內容
2026-07-21 日報
模型發布

Laguna S 2.1正式發布

Hacker News綜合 2 家報導
poolside 發布 Laguna S 2.1,這款 Mixture-of-Experts(MoE)模型共有 118B 參數、每個 token 啟用 8B 參數,thinking 與 no-thinking 模式均支援最高 1M tokens 的 context window,從開始訓練到推出不到九週。官方評測顯示,其在 Terminal-Bench 2.1、SWE-Bench Multilingual、SWE-Bench Pro、DeepSWE、SWE Atlas 與 Toolathlon Verified 分別取得 70.2%、78.5%、59.4%、40.4%、46.2%及 49.7%,並公開最終評估集每次試驗的完整 trajectories。Prime Intellect 稱它是同等規模下表現強勁的 open model,使用者可透過其平台進行 post-training、部署與 inference。
讀原始報導

背景

Mixture of Experts(MoE)不同於每個 token 都動用全部參數的密集式 Transformer,而是只啟用部分專家與參數,因此比較 MoE 模型時也需留意啟用參數量。DeepSWE 是評估 AI 程式開發代理的長程軟體工程基準,任務涵蓋 91 個程式碼儲存庫與 5 種語言,並以手寫驗證器檢查軟體行為,而非實作細節。

社群討論

整體風向高度正面,留言認為這款 118B、8B active 的 MoE 模型兼具 open weights、長上下文推理與可自架性;實測有人稱其比 DS4-Flash 快 2 倍且稍聰明,能找出過去僅 GPT-5.2 發現的 C 程式碼問題,並已產出可用 PR。主要疑慮是它也曾誤判 memfd_create()/mmap 用於 IPC、在非程式題輸給 DS4-Flash,且被指偏諂媚;另有測試者提醒預設設定可能未真正啟用 THINKING,內附 generation_config.json 的 max_new_tokens 為 32k,可能截斷思考。社群也關注 64GB 裝置的量化版本、Mac/消費級硬體速度與未明確揭露的價格,並質疑 benchmark 是否足以支持其勝過更大型模型的宣稱。

來源