模型發布
阿里開源 Qwen3.8-Flash 多模態 MoE 模型:125B 參數僅激活 6B,API 定價為 DeepSeek-V4-Flash 三分之一
X @Alibaba_Qwen綜合 5 家報導多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。
阿里通義千問團隊正式發布並開源多模態 MoE 模型 Qwen3.8-Flash(開源權重版本為 Qwen3.8-Flash-Next),作為全新一代 Qwen4 系列架構的早期預覽。該模型已於 QwenCloud API 上線,並首發應用於「千問辦公」。
在參數與架構方面,主模型參數為 125B,額外配備 51B 的 N-gram Embedding,每 token 僅需激活 6B 參數。針對上下文長度,官方文件顯示其預設支援 1M tokens 並具備內建工具,而據報導,其原生支援 262,144 tokens,是透過 YaRN 擴展至 1M。
Qwen3.8-Flash 圍繞四個方向進行系統升級:
- **Attention**:採用 GDN(Gated DeltaNet)與 QSA(Qwen Sparse Attention)混合架構。QSA 在 micro-block 粒度上篩選上下文,在 1M token 下的 Prefill 和 Decode 階段分別實現最高 7.6 倍與 4.9 倍加速。
- **Residual**:引入 Gated Residual(GR)機制,將殘差流擴展為 4 條並行分支,並支援 FP8 儲存以降低訪存開銷。
- **Embedding**:51B 參數的 N-gram Embedding 可卸載至 Host Memory,透過非同步 Prefetch 與模型計算重疊,不長期佔用 GPU 記憶體。
- **Optimization**:採用 Muon Optimizer,並針對新架構重新擬合 Scaling Law。
在效能與成本上,Qwen3.8-Flash 訓練成本僅約為 Qwen3.7-Plus 的九分之一。僅完成預訓練的基座模型在 SuperGPQA、GSM8K 及 SWEBench-Pretrain 等能力上,超越了體積 3 倍大的 Qwen3.7-Plus;經後訓練後,其在 SWE-bench Pro 評測中領先 Claude Opus4.6 達 9.1 分,整體效能接近 Opus4.8。
API 定價方面,QwenCloud 輸入為每百萬 tokens 0.16 美元,輸出為 0.47 美元,據報導此價格最低僅為 DeepSeek-V4-Flash 的三分之一。
讀原始報導背景
Qwen3.8-Flash 是一款多模態 MoE 模型,為 Qwen4 架構的早期預覽版,具備 125B 參數與 51B N-gram。其官方正式版本是基於 Qwen3.8-Flash-Next 開發,並採開放權重(open-weight)釋出。
來源
- Hacker Newsqwen.ai
- iThome 中國ithome.com
- AI 科技評論leiphone.com
- Reddit r/LocalLLaMAreddit.com
- X @Alibaba_Qwenx.com
- huggingface.co