跳到主要內容
2026-09-02 日報
模型發布

DeepSeek V4 開源多模態模型權重,揭露 32 層 ViT 與專屬 MoE 視覺路由機制

AI 科技評論單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,DeepSeek V4(V4-Flash-Vision-Exp)已公開多模態模型的權重與參考推論程式碼,揭露其將視覺特徵整合至長上下文與 AI 代理(Agent)主幹的技術細節。該模型自 8 月 21 日起已接入 API。 視覺前端採用 32 層 ViT 架構,隱藏維度為 1024,具備 16 個注意力頭(Attention Head)與 14 的 patch size,並使用二維 RoPE 進行位置編碼,以保留網頁或 GUI 介面的空間關係。 在視覺與語言主幹之間,模型透過 Aligner 將相鄰 3x3 的視覺特徵合併,經兩層映射轉換至 V4 的 4096 維度空間,使視覺網格規模縮減至九分之一,單張圖片進入語言主幹的預算上限被控制在 384 個 Token。視覺 Token 進入主幹後,會主動改變二維網格的線性排列,並與 4 Token 邊界對齊(COMPRESS_PAD_TO = 4),以配合 V4 內部壓縮比例為 4 的壓縮層。 為適應視覺特徵,V4 修改了注意力與路由機制。由於單圖 Token 數超過常規的 128 Token 局部滑動窗口,系統加入 `get_image_visible()` 擴展圖片內部的可見範圍,並要求整段圖片須在 prefill 階段一次寫入。在 MoE 路由方面,視覺 Token 被放置於常規 129,280 詞表範圍外,跳過語義 ID 路由,改用專屬的 `bias_vl` 調整 top-k 專家選擇順序,並根據隱藏狀態從 256 個專家池中重新分配 6 個專家。
讀原始報導

背景

混合專家模型(MoE)是一種機器學習技術,透過多個專家網路將問題空間劃分為同質區域。在 DeepSeek V4 的多模態架構中,圖片經過視覺編碼後會直接進入 Token 序列,並參與 MoE 路由與後續的推理過程。

來源