阿里開源 Qwen3.8-Flash 多模態 MoE 模型:125B 參數僅激活 6B,API 定價為 DeepSeek-V4-Flash 三分之一
作為 Qwen4 架構預覽,新模型訓練成本大降近 90%,並引入 GDN 與 QSA 混合注意力機制,在程式評測 SWE-bench Pro 領先 Claude Opus4.6 達 9.1 分。
64 則值得知道的變化
作為 Qwen4 架構預覽,新模型訓練成本大降近 90%,並引入 GDN 與 QSA 混合注意力機制,在程式評測 SWE-bench Pro 領先 Claude Opus4.6 達 9.1 分。
該模型總參數 320B、啟用參數 18B,效能追平 Claude Opus 4.8,定價僅為其四十分之一,全數由中國國產晶片提供算力。
提供即時串流與預錄處理雙 API,轉錄速度較 Chirp 3 提升 70%,並支援函數呼叫,可委託其他 Gemini 模型執行背景任務。
作為 Qwen4 架構預覽,此多模態 MoE 模型每次啟動 6B 參數,透過混合架構消除 KV Cache 增長,百萬上下文預填裝吞吐量達前代 8.6 倍。
新版同步納入 BioHub 蛋白質摺疊模型 ESMFold2,並將舊版張量平行處理全面替換為 DTensor 原生後端。
該 MoE 模型運行於 11 套 GB200 NVL72 系統,預計耗時三個月,並即時公開所有實驗配置、中途修改與失敗紀錄。
受惠於 AI 生態系公允價值增長,商湯上半年營收達 29.11 億人民幣並首度扭虧為盈,期內日均 Token 服務量達 2.4 兆。
模型以 10.9 萬小時無標註資料預訓練,在糖尿病風險等七項臨床預測任務中表現優異,並於餐後血糖預測取得最低平均絕對誤差。
由 fal 基於 MiniMax H3 後訓練與部署,在包含音訊的評測中拿下圖生影片第一與文生影片第三,成績全面超越基礎模型。
新模型已上線 Pavo 創作平台,內建無限畫布與 3D 導演台功能,標準版支援多圖與音影片參考,每日贈送可生成百秒影片的額度。
該稀疏模型支援影像、語言指令與機器人狀態輸入,經百萬小時影片訓練,讓機器人能在工廠環境中同時處理感知與控制。