模型發布
阿里發布 Qwen3.8-Flash-Next 176B 模型權重,NVIDIA 宣布 GB300 NVL72 提供 Day-0 支援
NVIDIA Developer一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

阿里巴巴發布 Qwen3.8-Flash-Next 176B 模型權重,作為即將推出的 Qwen4 架構預覽版,NVIDIA 同步宣布透過 SGLang、vLLM 與 TensorRT LLM 提供 Day-0 支援。該模型為多模態混合專家(MoE)架構,總參數量達 176B(包含 51B N-gram 嵌入參數),每個 token 啟動 6B 參數,原生支援 262,144 token 上下文,並可透過 YaRN 擴展至 1M。
為解決長上下文的注意力運算與 KV Cache 記憶體瓶頸,模型採用 Gated DeltaNet(GDN)與 Qwen Sparse Attention(QSA)混合架構。四分之三的層數使用 GDN 將歷史上下文壓縮為固定大小的循環狀態,消除序列變長時的 KV Cache 增長;其餘四分之一層數則使用 QSA 將序列聚合為微區塊並評估重要性,進行全上下文的精確檢索。
阿里基準測試顯示,在 1M 上下文與 90% 前綴快取(prefix-cache)命中率的線上服務測試中,Qwen3.8-Flash-Next 的預填裝(prefill)吞吐量達 Qwen3.7-Plus 的 8.6 倍;與全注意力機制相比,QSA 核心在預填裝與解碼階段分別帶來最高 7.6 倍與 4.9 倍的加速。
NVIDIA 指出,該模型在配備 72 張 Blackwell Ultra GPU、NVLink 頻寬達 130 TB/s 的 GB300 NVL72 平台上,每張 GPU 每秒可處理超過 16K tokens,單一使用者每秒超過 200 tokens;同時也支援在配備四張 RTX PRO 6000 Blackwell Max-Q 的工作站等本機硬體上執行。開發者可透過 NVIDIA NeMo AutoModel 進行 SFT 或 LoRA 微調,並使用 NeMo RL 進行強化學習,模型權重已於 Hugging Face 與 ModelScope 開放下載。
讀原始報導背景
Qwen3.8-Flash-Next 結合了多項先進技術來處理長文本。其中,YaRN 是一種能高效擴展模型上下文長度的技術,與過去的方法相比,可減少 10 倍的 token 需求與 2.5 倍的訓練步驟。此外,該模型採用的 Gated DeltaNet 架構,在長文本理解與上下文檢索等多項基準測試中,表現皆優於 Mamba2 等現有模型。