阿里開源 Qwen3.8-Flash 多模態 MoE 模型:125B 參數僅激活 6B,API 定價為 DeepSeek-V4-Flash 三分之一
作為 Qwen4 架構預覽,新模型訓練成本大降近 90%,並引入 GDN 與 QSA 混合注意力機制,在程式評測 SWE-bench Pro 領先 Claude Opus4.6 達 9.1 分。
X @Alibaba_Qwen綜合 5 家多家報導
64 則值得知道的變化
作為 Qwen4 架構預覽,新模型訓練成本大降近 90%,並引入 GDN 與 QSA 混合注意力機制,在程式評測 SWE-bench Pro 領先 Claude Opus4.6 達 9.1 分。
該模型總參數 320B、啟用參數 18B,效能追平 Claude Opus 4.8,定價僅為其四十分之一,全數由中國國產晶片提供算力。
團隊澄清額度重置為單純補償機制,並透露 Ultra Fast 模式理論提速達 14 倍,但受網路開銷限制,實際體感僅 3 至 4 倍。