跳到主要內容
2026-09-09 日報
前瞻與傳聞

據報 inclusionAI 釋出多模態模型 Ling-3.0-flash-VL:124B 參數、支援 1M token 上下文

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群與 Hugging Face 頁面資訊,inclusionAI 釋出多模態模型 Ling-3.0-flash-VL。該模型繼承 Ling-3.0-flash 的語言與推理能力,並擴展原生的圖像與影片理解功能。模型總參數達 124B,採用稀疏 MoE 架構,每次 token 僅啟動 5.5B 參數,支援高達 1M token 的上下文長度。 在架構設計上,該模型透過 ViT 視覺編碼器與雙層 MLP 投影層對齊視覺與文本特徵;導入 VideoRoPE 編碼空間位置與時間順序,支援事件定位、長影片問答與影片片段編輯等任務;其 42 層混合骨幹網路以 5:1 比例交替使用 KDA 與 Gated MLA 層,以提升跨文本、圖像、影片及代理工作流程的長上下文處理效率。
讀原始報導