模型發布
DeepSeek 發布 V4 首款多模態模型 DeepSeek-V4-Flash-Vision-Exp,大幅提升視覺代理能力並採 MIT 授權
HF @deepseek-ai綜合 2 家報導一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
DeepSeek 於 Hugging Face 上架 V4 系列首款實驗性多模態模型 DeepSeek-V4-Flash-Vision-Exp,並採 MIT 授權開放權重。該模型基於 DeepSeek-V4-Flash 架構,整合視覺模組並經過持續訓練以解鎖視覺理解能力,底層涵蓋 DFlash attention、MoE、Hyper-Connections 與 DSpark 前向路徑。在效能表現上,相較於 DeepSeek-V4-Flash-0731,新模型在多模態代理能力有顯著提升,ApexBench (Pass@1) 達 36.5(前代因忽略視覺元素僅 26.2)、Chartography 達 64.3,同時維持了同等的純文字任務效能,其 Terminal Bench 2.1 測得 83.9。官方提供的開源庫包含 tokenizer、提示編碼參考及輕量級 PyTorch 推論實作,支援 OpenAI 格式的 JSON 內容區塊與 `<image>path</image>` TXT 標記。開發者可透過 Transformers pipeline 直接載入,或使用 vLLM、SGLang 及 Docker Model Runner 進行本地端部署與伺服器架設。
讀原始報導背景
DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek-V4 系列的首款實驗性多模態模型,建立在 DeepSeek-V4-Flash 架構之上。該模型支援同時輸入影像與文字,具備描述圖片、讀取截圖文字與分析圖表等功能。
來源
- HF Trendinghuggingface.co
- Reddit r/LocalLLaMAreddit.com
- Reddit r/LocalLLaMAreddit.com
- api-docs.deepseek.com
- huggingface.co