DeepSeek V4 開源多模態模型權重,揭露 32 層 ViT 與專屬 MoE 視覺路由機制
影像經壓縮後以最高 384 個 Token 進入語言主幹,系統並為視覺特徵獨立修改了注意力滑動窗口與專屬 MoE 專家分配路徑。
68 則值得知道的變化
影像經壓縮後以最高 384 個 Token 進入語言主幹,系統並為視覺特徵獨立修改了注意力滑動窗口與專屬 MoE 專家分配路徑。
該系統解決 VLM 球員兼裁判的缺陷,透過瀏覽器執行並驗證修復結果,僅將通過認證的程式碼用於監督式微調。
該模型總參數 125B,每 token 僅啟動 6B,並將 51B 的 n-gram 嵌入表置於加速器外,以極低算力成本達成超越前代的預訓練效能。
實驗顯示 GPT-5 與 Gemini-3 已編碼 95% 至 98% 的測試事實,證明幻覺主因是提取失敗而非缺乏知識,可透過推論期運算解決。
VAT 透過在訓練時模擬循序驗證並動態調整損失權重,無需修改模型架構即可疊加於現有方法,優化大型語言模型推理效率。
透過分離研究問題與評估準則,該框架將準則外洩率降至 3.7%,並開源兩萬筆資料的 PaperGym-20k 語料庫與兩項評測基準。
該方法基於 100 款 LLM 與 3.4 萬道題目訓練,能獨立還原出安全與推理兩大維度,證實單一評測分數常混雜不同能力訊號。
該框架將生命計算拆分為感知、演化與生成三類算子,透過尺度橋連結細胞至器官,首個心臟計算專案預計年底完成迭代以支援虛擬臨床。
據社群探討,潛在推理以連續隱藏狀態取代傳統思維鏈,已發展出連續思考等五大分支,並引發業界對失去可讀軌跡後模型可解釋性的隱憂。
測試發現 197 個傳統策略無法修復的 Agent 突變。經 gpt-oss-120b 與 Qwen3.8-27B 驗證,擴展恢復語言與精確狀態定位能大幅提升恢復率。