跳到主要內容
2026-09-02 日報
模型發布

Qwen 發表 Qwen3.8-Flash-Next 125B MoE 架構:訓練 FLOPs 降至 1/9,結合 Gated DeltaNet 與稀疏注意力

HF Daily Papers一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Qwen 團隊發表 Qwen3.8-Flash-Next 論文,揭露其 125B 稀疏混合專家 (MoE) 模型的架構設計與訓練細節。該模型總參數為 125B,每個 token 僅啟動 6B,並將額外 51B 參數的 n-gram 嵌入表置於加速器外,由主機記憶體預取以擴充模型容量。 在效能與成本對比上,與前代 397B(啟動 17B)模型相比,Qwen3.8-Flash-Next 僅需 1/3 的啟動參數、1/3 的訓練 tokens 及約 1/9 的訓練 FLOPs。在 14 項預訓練基準測試中,新架構取得 8 項領先,其餘項目最多落後 2.6 分。 架構層面,Token mixing 採用逐層混合 Gated DeltaNet (GDN) 與全局注意力,每四層設置一層全注意力層;在持續預訓練階段,全注意力層會替換為 Qwen Sparse Attention (QSA),透過壓縮輕量索引器在微區塊粒度上進行上下文評分。此外,殘差流被加寬至四個分支並透過逐元素門控讀取,稱為 Gated Residual (GR)。 團隊在評估中發現,Loss 與下游準確率並非完全同步,例如擴大 n-gram 詞表會使 Loss 單調下降,但下游準確率會達到飽和。該架構結合 Muon 最佳化器後,無需 batch-size warmup 即可提高最佳學習率與 batch size,並在壓力測試中大幅提升了訓練穩定性。
讀原始報導

背景

混合專家模型(MoE)是一種集成學習技術,透過多個專家網路來分工處理不同的問題空間。本次發布的 Qwen3.8-Flash-Next 架構結合了 MoE 與 Gated DeltaNet(GDN),而 GDN 是近期被證實能在語言建模與長文本理解等測試中超越 Mamba2 的新架構。

來源