跳到主要內容
2026-09-18 日報
研究與評測

智譜展示 RSI 早期成果:GLM-5.3 Infra Agent 兩週內完成十萬顆國產晶片集群部署,吞吐量提升 3.2 倍

愛範兒綜合 2 家報導多家報導
核實資料不足

多個報導來源提及此事;未必是彼此獨立的證據。

本次未取得足夠原文證據

智譜創始人唐杰分享遞迴自我改進(RSI)早期成果,由 GLM-5.3 驅動的 Infra Agent 參與優化 GLM-5.3-Flash 推理系統,在兩週內完成超過 10 萬顆國產 AI 加速器集群的生產級部署。優化後系統端到端吞吐能力提升 3.2 倍,硬體利用率與單 token 成本接近主流 NVIDIA GPU 平台。該模型曾以匿名「Ox-Alpha」在 OpenCode 與 OpenRouter 測試,六天內處理逾 62 兆個 token。 針對國產晶片顯示記憶體與頻寬限制及 100 萬 token 長上下文需求,團隊採用 ReplaySSM 用計算換取記憶體空間、節點內張量平行降低顯示記憶體壓力,並引入混合精度快取(INT8/FP8/BF16)與 Encode-Prefill-Decode (EPD) 分離式架構。 透過引入「dense feedback」機制,Agent 能夠讀取系統反饋並修改程式碼:其發現 TF32 捨入誤差導致的長上下文精度問題,修復已合併至 Flash Linear Attention PR #1180;定位 Python GIL 未及時釋放導致的併發阻塞,將 KV Transfer 的額外開銷(愛範兒報導為逾 30%,量子位報導為逾 20% 的效能損失)降至 1% 以下;並透過學習開源專案重組 Decode Kernel 計算結構,獲 1.71 倍效能提升。 唐杰強調,目前距離真正的 RSI 仍遠,目標設定與高風險審核仍由人類工程師負責,但已形成「模型優化系統,系統服務模型」的初步閉環。
讀原始報導

背景

本次智譜團隊採用的 ReplaySSM 技術,主要是透過在小型環形緩衝區中快取近期的 SSM 輸入,取代每次解碼步驟都要將狀態寫回記憶體的作法,藉此加速混合模型的解碼速度。此外,Encode-Prefill-Decode(EPD)分離式架構則支援評估多種配置(如完全獨立的 E/P/D 或合併特定階段),讓系統調度更具彈性。

來源