跳到主要內容
2026-08-28 日報
研究與評測

Qwen 3.8 Flash Next 架構解析:結合 N-gram 與 512 專家 MoE,將 51B 參數卸載至 SSD

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據社群網友解析,Qwen 3.8 Flash Next(Qwen4Exp)採用混合架構,將部分參數卸載至 N-gram 表格而非純混合專家(MoE)架構。該模型總參數約 176B,具體包含 125B 的 512 專家 MoE 網路(存於 RAM)與 51B 的 N-gram 表格(存於 SSD),並整合了 Gated DeltaNet 與 Qwen 稀疏注意力機制(QSA)。 解析指出,MoE 負責算術與推理,但因路由選擇較晚且資料量大,難以從硬碟快速讀取;N-gram 則負責記憶召回,透過近期 token 的雜湊值提早尋址,僅需提取數 kB 資料即可融入資料流。此架構使模型每次僅需啟動約 6B 參數,具備 125B 模型的推論速度,同時享有 176B 的參數容量。 在固定預算下,目前技術極限約可將 20% 至 25% 的參數卸載至 N-gram 表格以達到最佳效益;若比例過高將導致模型失去推理能力,退化為單純的記憶提取機。
讀原始報導

背景

混合專家模型(MoE)是一種機器學習技術,透過多個專家網路分擔運算,能在相同的運算預算下大幅擴展模型規模。近期 Qwen 提出的實驗性架構結合了 MoE 與 n-gram 技術,試圖在模型的推理與記憶提取能力之間取得平衡。

來源

本期分類