跳到主要內容
2026-09-11 日報
模型發布

DeepSeek 發布 552B 多模態模型 V4.1-Flash:輸入僅啟動 8B 參數,KV Cache 縮減至前代四分之一並下調 API 定價

HF Trending綜合 4 家報導一手來源
核實資料不足

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

查證回合用盡,未形成有依據結論

DeepSeek 於 10 日發布全新多模態 MoE 模型 DeepSeek-V4.1-Flash,並登上 Hugging Face 熱門。該模型具備 552B 骨幹參數,支援 100 萬 Token 上下文,原生支援影像與文字處理。其採用全新的 Causal-Encoder-Decoder (CED) 架構,包含 20 層編碼器與 20 層解碼器,使輸入與輸出運算不對稱:Prefill(輸入)階段每 Token 僅啟動 8B 參數,Decode(輸出)階段啟動 16B 參數,運算成本顯著低於同尺寸模型。 針對 Agent 任務的長文本需求,V4.1-Flash 大幅壓縮 KV Cache。透過 SWA Bounded Replay 技術,對 SSD 的持久化快取需求降至前代 V4-Flash 的八分之一;結合 Compressed Sparse Attention 2 (CSA2) 與 FP4 快取格式,全域 KV Cache 縮減至每 Token 890 bytes,對 HBM 記憶體的需求降至前代的四分之一。 模型基於 45T Token 的多模態資料集從頭預訓練,並在後訓練階段導入大規模自動化 Agent 任務合成資料,支援 1 至 100 的可控推理強度(Reasoning effort)設定。據報導,其程式能力追平 OpenAI 與 Anthropic 的頂尖閉源模型,並在各項指標超越自家的 DeepSeek V4 Pro,但在複雜科學任務與影像分析上仍有弱點。 官方已同步上線 DeepSeek API,呼叫名稱為 `deepseek-flash`。受惠於架構創新降低成本,V4.1-Flash 的 API 定價相應下調,並維持離峰時段半價的峰谷定價機制。舊版 V4 Flash 與 V4 Flash Vision Exp 現已下線,API 請求將暫時路由至新模型;此外,由於新模型效能全面超越,官方計畫有序下線 V4 Pro 模型。
讀原始報導

背景

vLLM 與 SGLang 皆為開源的大型語言模型推論與伺服框架,能協助開發者高效部署多模態模型。其中 vLLM 源自加州大學柏克萊分校,核心技術為針對 Transformer 鍵值快取(KV cache)的記憶體管理方法 PagedAttention;SGLang 則由 LMSYS 等機構的研究人員推出,結合 Python 嵌入語言以實現高吞吐量推論。

這則事件的發展

  1. 2026-09-10傳 DeepSeek 將推 v4.1 flash 模型,定價更低且能力超越 v4 pro

來源