DeepSeek V4 開源多模態模型權重,揭露 32 層 ViT 與專屬 MoE 視覺路由機制
影像經壓縮後以最高 384 個 Token 進入語言主幹,系統並為視覺特徵獨立修改了注意力滑動窗口與專屬 MoE 專家分配路徑。
AI 科技評論單一來源
68 則值得知道的變化
影像經壓縮後以最高 384 個 Token 進入語言主幹,系統並為視覺特徵獨立修改了注意力滑動窗口與專屬 MoE 專家分配路徑。
由 Jiashu Zhu 等十人團隊提出,採用門控跨模態注意力機制與強化學習,並透過自迴歸單步優化管線達成同步高畫質輸出,解決傳統生成中音訊分離的問題,模型將開源。
據社群發現,該模型採獨立架構,跑分稱 4B 版本逼近 Qwen 3.5 9B,目前需透過客製化 llama.cpp 分支執行。