vLLM 發布 v0.30.0:支援 DeepSeek-V4.1-Flash 等模型,引入 Fast Start 權重快取與 HiSparse 架構
已查原文 · 5 項主張
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
經核實 vLLM v0.30.0 的官方發布日誌,報導中的各項主要宣告皆屬實。包含新增 DeepSeek-V4.1-Flash 等多種模型、利用 Fast Start 與 HiSparse 提升記憶體與啟動效率、Model Runner V2 加速引擎初始化至 8.2 秒、確保 FP8 模型可置入單張 GB300 等效能優化,以及棄用舊版 grpc_server 模組,皆與原文相符。
引入 Fast Start 功能透過 CUDA IPC 取代硬碟載入;HiSparse 架構可將 KV 頁面溢出至主機記憶體。
日誌指出引擎重啟能透過 CUDA IPC 映射權重,且在 GPU 壓力下可將 KV 頁面溢出。
over CUDA IPC
查看原始出處
spills KV pages
查看原始出處
Model Runner V2 將 H200 上的引擎初始化時間從 28.9 秒縮短至 8.2 秒。
日誌在 Model Runner V2 更新中提及了 H200 的具體初始化加速數據。
from 28.9s to 8.2s
查看原始出處
Qwen3.8 最佳化移除 torch.compile,使 FP8 模型可放入單張 GB300。
官方發布中明確說明移除 NVIDIA 實作的 torch.compile 可將 FP8 模型放入單張 GB300。
fits on a single GB300
查看原始出處
其他包含浮水印、量化等更新,並棄用 grpc_server 模組,改用 vllm serve --grpc。
在破壞性變更 (Breaking changes) 中提到 grpc_server 被棄用並改為 vllm serve。
favor ofvllm serve
查看原始出處
背景
本次 vLLM 更新支援了多項新技術與模型,其中 MXFP8(Microscaling FP8)是 NVIDIA Blackwell 架構 GPU 原生支援的 8 位元資料格式,能以較低的記憶體使用率提升推論效率。此外,更新中整合的 FlashMLA 則是 DeepSeek 所開發的最佳化注意力機制核心庫(attention kernels)。