阿里開源 Qwen3.8-Flash 多模態 MoE 模型:125B 參數僅激活 6B,API 定價為 DeepSeek-V4-Flash 三分之一
作為 Qwen4 架構預覽,新模型訓練成本大降近 90%,並引入 GDN 與 QSA 混合注意力機制,在程式評測 SWE-bench Pro 領先 Claude Opus4.6 達 9.1 分。
X @Alibaba_Qwen綜合 5 家多家報導
64 則值得知道的變化
作為 Qwen4 架構預覽,新模型訓練成本大降近 90%,並引入 GDN 與 QSA 混合注意力機制,在程式評測 SWE-bench Pro 領先 Claude Opus4.6 達 9.1 分。
該模型總參數 320B、啟用參數 18B,效能追平 Claude Opus 4.8,定價僅為其四十分之一,全數由中國國產晶片提供算力。
作為 Qwen4 架構預覽,此多模態 MoE 模型每次啟動 6B 參數,透過混合架構消除 KV Cache 增長,百萬上下文預填裝吞吐量達前代 8.6 倍。
該 MoE 模型運行於 11 套 GB200 NVL72 系統,預計耗時三個月,並即時公開所有實驗配置、中途修改與失敗紀錄。
Runway 宣布即日起在平台上提供 Meta 的 Muse Image 模型,與現有影像及影片模型並列,其底層 Muse-Glimmer-30B 採開源 Apache 2.0 授權。
該框架基於 Wan2.1 模型,透過三階段蒸餾將推理步數降至 4 次,並結合遮罩快取機制減少未編輯區域計算,已被 ECCV 2026 接收。
該稀疏模型支援影像、語言指令與機器人狀態輸入,經百萬小時影片訓練,讓機器人能在工廠環境中同時處理感知與控制。