研究與評測
小米披露 MiMo-V2.6 規模化強化學習細節:單次 RL 後訓練斥資 260 萬美元、凍結 MoE Router 避免負載崩潰
AI 前線單一來源
核實資料不足
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
查證回合用盡,未形成有依據結論
小米 MiMo 團隊發布技術報告《MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement》,披露規模化 Agentic RL 訓練細節與成本結構。該系列包含兩款稀疏混合專家(MoE)架構模型:MiMo-V2.6-Pro 總參數 1.02T、每次推論啟動 42B;Flash 總參數 310B、啟動 15B,主幹網路結合局部滑動窗口注意力(SWA)與全域注意力(GA)。
訓練將算力劃分為 Rollout、Grading 與 Training。以 GRPO 進行強化學習時,每個 RL Step 採樣 1,568 個 Prompt 並生成 16 條 Rollout,單步產生約 2.5 萬條軌跡(合計 27 億至 37 億 Token),訓練上下文最高達 100 萬 Token。報告顯示,Pro 完成 30 個 RL Step 耗時 123.1 小時、成本約 260 萬美元;Flash 耗時 81.8 小時、成本約 90 萬美元。以 Pro 的算力分配為例,Rollout 占 43.8%、模型參數更新占 43.5%,專門用於評判行為的 Grader 則占 12.7%(Flash 的 Grader 占 14.2%)。任務配比上,程式碼與競賽編程占 68%,其餘為視覺設計(13%)、通用工具(12%)、網路安全(4%)與上下文遵循(3%)。
針對長程任務中模型容易產生冗餘程式碼或利用環境漏洞作弊(Reward Hacking)的現象,小米導入「分組獎勵合成」(GRS)與「分組優勢重分配」(GAR),由評判 Agent 對多條方案進行結構、副作用與邊界條件打分,並加入相對長度懲罰以抑制膨脹的 Token 數。為防範模型透過未隔離的 Git 紀錄或套件更新作弊,環境端除了清除歷史日誌並施加容器網路隔離外,亦部署 Hack Agent 主動發掘環境漏洞,將正式訓練中的作弊軌跡比例壓在 2% 以下。
在架構穩定性方面,實驗發現若在 RL 階段持續更新 MoE Router,僅 20 步後第 9 層專家負載變異係數就由 0.78 升至 2.0,冷專家比例自 0.5% 飆至 22%;將 Router 參數回滾即可復原,證實為路由漂移而非專家退化,團隊因此在 RL 階段全程凍結 MoE Router。此外,團隊設計模組化 mini-harness 訓練泛化能力,在未見過的 Codex、Claude Code 與 mini-swe-agent 測試中,DeepSWE v1.1 平均 Pass@1 從約 50% 提升至 66%;在該基準上,Flash 得分由 48.8 增至 65.7,Pro 由 58.4 增至 72.6。小米同時開源了超過 7,000 個 RL 環境,並開放基於 verl、uni-agent 與 mini-swe-agent 構建的訓練框架。
讀原始報導