跳到主要內容
2026-08-06 日報
模型發布

螞蟻集團解析 Ming-flash-omni 全模態模型:2.0 版達千億參數,首創 AnyExperts 動態分配 MoE 專家

InfoQ 中國多家報導
尚未逐項核實

多個報導來源提及此事;未必是彼此獨立的證據。

螞蟻集團日前解析其全模態統一模型 Ming-flash-omni 的技術架構與訓練實踐。最新發布的 Ming-flash-omni 2.0 採用 Ling-2.0 的 MoE 架構,總參數達 1,000 億,活躍參數為 60 億。該模型在端到端語音理解與生成基準測試 ContextASR-Bench 的 12 項指標中,均取得 SOTA(當前最佳)成績。 針對多模態 MoE 架構的模態分化問題,該模型採用 Multi-router 方案,為視覺、音訊與文本配置獨立的 router 與均衡策略,確保各模態 token 依自身特徵分配專家,避免被語言模型的路由習慣主導,實測效果超越各模態獨立訓練的 baseline。 為解決影像與影片的高冗餘度問題,團隊設計 AnyExperts 模組,放棄固定分配 k 個專家的傳統作法,改為依據 token 重要性動態分配專家數量。例如在影片中,當人物出現時的關鍵影格會獲配更多專家,背景冗餘 token 則減少分配。在工程實作上,推論時會為分配較少專家的 token 補上「空專家」(恆等變換)以維持矩陣運算規整性,在相同專家預算下同時提升模型效果與推論速度。 在訓練策略上,團隊將模型能力拆解為感知力、知識力、推理力與行動力四個階段,並透過監控 validation loss curve 動態調整學習率:當任務處於快速收斂期時調大學習率,曲線趨緩時則調低以避免過度擬合。若特定模態資料量不足,則針對重要 token 進行上採樣或啟動資料補採。 團隊也證實原生多模態訓練的優勢。相較於在已訓練好的語言模型上外掛視覺編碼器的橋接(Bridge)模式,在預訓練早期直接引入多模態序列,能讓多模態與語言表徵空間更早對齊。實測顯示,在訓練早期僅引入 20% 多模態資料的效果,大幅優於在訓練晚期引入 80% 多模態資料的表現。
讀原始報導

背景

隨著人工智慧發展,業界正從語言模型外掛視覺或聽覺模組,轉向原生支援多種資料型態的「全模態統一」架構。Ming-Flash-Omni 是一款具備千億參數的全模態大模型,透過改良混合專家(MoE)架構,讓單一模型能同時處理文字、影像與音訊的理解及生成任務。

來源