跳到主要內容
2026-08-19 日報
研究與評測

九章智算雲部署 GLM-5 與 DeepSeek R 系列,透過動態匹配 Generator 與 Trainer 實現 RL 訓推一致

AI 科技評論單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,九章智算雲已部署 GLM-5 系列與 DeepSeek R 系列等主流推理模型,透過將強化學習(RL)的 Generator、Environment 與 Trainer 納入統一工作流,解決動態匹配問題以實現「訓推一致」。 在模型表現上,智譜公告指出 GLM-5.3 與 GLM-5.2 在相同基座上推進 RL,其中 GLM-5.2 在 SWE-bench Pro 取得 62.1 分、Terminal-Bench 3.0 達到 81.0 分。此外,九章智算雲與中國人民大學 STILL 專案團隊聯合發布的研究顯示,DeepSeek-R1-Distill-Qwen-1.5B 透過持續 RL 迭代,在 AIME 2024 準確率達 39.33%,研究並指出透過動態更新 Reward Model 的 Cooper 方法可有效緩解 Reward Hacking。 在基礎設施效能方面,九章智算雲透過全局動態調度,在 MiniMax M2.1 229B 和 Qwen3-Coder-Next 80B 等模型上,首日速度提升 1.5 倍;隨流量變化,速度比靜態預測器再提升 1.25 倍。系統將在線投機者學習重新定義為生產環境中的異步 RL 問題,允許新權重熱插拔至伺服器,達成零停機時間。 底層架構上,該平台採用 DingoFS 分布式檔案底座、DFKV 分布式快取、全域零拷貝鏈路與 RDMA 高速網路,將 KV Cache 從單 GPU 臨時快取升級為可跨任務複用的狀態資源,藉此降低 RL 閉環中跨節點搬運與重複 Prefill 的非計算開銷。
讀原始報導

背景

隨著大型語言模型發展,強化學習(RL)已成為提升數學推理、程式生成與 Agent 等高階能力的關鍵,使模型訓練從單次預訓練轉向持續性的生成與回饋循環。為了準確評估這些自主軟體工程 Agent 的能力,業界常使用 SWE-bench Pro 等具備抗污染機制的測試平台來模擬真實開發環境。九章智算雲為此構建了整合 Generator、Environment 與 Trainer 的動態調度系統,以解決 RL 過程中算力閒置與資料過時的工程瓶頸。

來源