DeepSeek 發布 V4 首款多模態模型 DeepSeek-V4-Flash-Vision-Exp,大幅提升視覺代理能力並採 MIT 授權
基於 V4-Flash 架構加入視覺模組,在多模態評測顯著超越前代並維持同等純文字效能,支援 vLLM 與 SGLang 部署。
HF @deepseek-ai綜合 2 家一手來源
47 則值得知道的變化
基於 V4-Flash 架構加入視覺模組,在多模態評測顯著超越前代並維持同等純文字效能,支援 vLLM 與 SGLang 部署。
開發者 Pieter Levels 透過 Claude Code 打造該網站,首日吸引 3.7 萬人觀看。底層模型由 fal Research 基於 MiniMax H3 優化,吞吐量達官方 35 倍。
解碼器基於 7400 小時音訊文本配對資料訓練以避免依賴純文本先驗,支援問答與 ASR,因沿用 NVIDIA 編碼器僅限非商業授權。