跳到主要內容
2026-07-22 日報
研究與評測

摩爾線程公布萬卡叢集訓練成績

鈦媒體據報導
據報導,摩爾線程宣稱在國產萬卡級叢集上,以 25T+ 語料從零完成 MoE-236B 模型從預訓練到長窗口訓練的全流程,有效訓練時長占比超過 90%。若結果獲得進一步證實,將顯示國產 AI 晶片具備訓練前沿大模型的潛力;目前消息僅有單一來源。
讀原始報導

背景

MoE(Mixture of Experts)由多個專門子網路處理不同類型的輸入,再由閘控網路協調選擇,這項概念直到大規模 Transformer 時代才快速發展。作為參照,DeepSeek-V2 同樣具有 2,360 億個總參數,但每個 token 僅啟用 21 億個參數。摩爾線程打造的夸娥(KUAE)智算集群可支援萬卡級擴展,採用 MUSA 統一架構,並保持對國際主流 GPU 生態的相容性。

來源