跳到主要內容
2026-09-23 日報
開發生態

vLLM 發布 v0.30.0:支援 DeepSeek-V4.1-Flash 等模型,引入 Fast Start 權重快取與 HiSparse 架構

GitHub vllm-project/vllm一手來源
已查原文 · 5 項主張

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

經核實 vLLM v0.30.0 的官方發布日誌,報導中的各項主要宣告皆屬實。包含新增 DeepSeek-V4.1-Flash 等多種模型、利用 Fast Start 與 HiSparse 提升記憶體與啟動效率、Model Runner V2 加速引擎初始化至 8.2 秒、確保 FP8 模型可置入單張 GB300 等效能優化,以及棄用舊版 grpc_server 模組,皆與原文相符。

vLLM 釋出 v0.30.0,支援 DeepSeek-V4.1-Flash 等多種新模型。

發布日誌的「新模型」章節明確列出了此模型。

DeepSeek-V4.1-Flash

查看原始出處

引入 Fast Start 功能透過 CUDA IPC 取代硬碟載入;HiSparse 架構可將 KV 頁面溢出至主機記憶體。

日誌指出引擎重啟能透過 CUDA IPC 映射權重,且在 GPU 壓力下可將 KV 頁面溢出。

over CUDA IPC

查看原始出處

spills KV pages

查看原始出處

Model Runner V2 將 H200 上的引擎初始化時間從 28.9 秒縮短至 8.2 秒。

日誌在 Model Runner V2 更新中提及了 H200 的具體初始化加速數據。

from 28.9s to 8.2s

查看原始出處

Qwen3.8 最佳化移除 torch.compile,使 FP8 模型可放入單張 GB300。

官方發布中明確說明移除 NVIDIA 實作的 torch.compile 可將 FP8 模型放入單張 GB300。

fits on a single GB300

查看原始出處

其他包含浮水印、量化等更新,並棄用 grpc_server 模組,改用 vllm serve --grpc。

在破壞性變更 (Breaking changes) 中提到 grpc_server 被棄用並改為 vllm serve。

favor ofvllm serve

查看原始出處
vLLM 釋出 v0.30.0 版本,新增支援 DeepSeek-V4.1-Flash(支援 SM100 上的 MXFP8 KV 快取與 DeepGEMM Mega-mHC)、DeepSeek-V4-Flash-Vision-Exp、GLM-5.3-Flash、Kimi K3、Qwen3.8-Flash-Next 等模型。 新版引入 Fast Start 功能,透過常駐 GPU 權重快取 daemon 與 CUDA IPC 映射,使引擎重啟時無須從硬碟重新載入權重,並支援 FP4 與多節點 TP。針對 sparse-MLA 解碼新增 HiSparse 架構,可在 GPU 記憶體壓力大時將 KV 頁面溢出至主機記憶體(pinned host memory)。 Model Runner V2 最佳化了圖形捕獲流程,在 H200 上將引擎初始化時間從 28.9 秒縮短至 8.2 秒,並支援 MTP 與 EAGLE3/DFlash/DSpark 投機解碼在 pipeline parallelism 下運行。 針對特定模型效能:Qwen3.8-Flash-Next 移除了 NVIDIA 實作的 torch.compile,使 FP8 模型可放入單張 GB300;Kimi K3 移除 KDA 混合批次操作提升 5.2-7.7% 端到端吞吐量,其分組 FP8 MLA 快取插入在小批次下核心加速 4-6 倍。 其他更新包含:新增相容投機解碼的 Gumbel-max 浮水印生成與檢測;針對無 NVLink 環境提供 FlashInfer PCIe IPC all-reduce;在 SM100/103 晶片上預設使用 FlashInfer CuTeDSL NVFP4 W4A16 量化。此外,Scale-out 端點改為手動啟用(`--enable-scale-out`),並棄用 `grpc_server` 模組,改由 `vllm serve --grpc` 取代。
讀原始報導

背景

本次 vLLM 更新支援了多項新技術與模型,其中 MXFP8(Microscaling FP8)是 NVIDIA Blackwell 架構 GPU 原生支援的 8 位元資料格式,能以較低的記憶體使用率提升推論效率。此外,更新中整合的 FlashMLA 則是 DeepSeek 所開發的最佳化注意力機制核心庫(attention kernels)。

這則事件的發展

  1. 2026-09-10vLLM 發布 v0.29.0:預設啟用 MRV2,並支援 Hy4-preview、Qwen3.8 與 Kimi K3 等未曝光模型

來源

本期分類