開發生態
vLLM 發布 v0.31.0:針對 DeepSeek-V4.1-Flash 效能最佳化,並推出 GPU 權重快取快速重啟功能
GitHub vllm-project/vllm一手來源
已查原文 · 3 項主張
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
經查證 vLLM 官方發布日誌(v0.31.0),報導所述的各項更新皆為真。包含 717 個 commits、預設採用 FlashMLA 強化 DeepSeek-V4.1-Flash、推出 `vllm preload` 權重快取、新增 MoonEP 部署後端與排程參數等。
vLLM 專案正式發布 v0.31.0 版本,此次更新包含 307 位貢獻者提交的 717 個 commits,重點強化 DeepSeek-V4.1-Flash 效能與快速重啟機制。
在 DeepSeek-V4.1-Flash 效能方面,SM100 架構預設採用搭配 V4.1 NVFP4 壓縮 KV cache 的 FlashMLA mega attention;系統整合了 DeepGEMM sparse MQA logits 與 Mega-Gate 融合技術,並支援 SM100/SM103 上的 MXFP8 量化與多項邊界融合最佳化。
針對快速重啟(Fast restart),新版推出 `vllm preload` CLI 啟動權重快取常駐程式,讓量化後的權重在引擎重啟時能保留於 GPU 記憶體中,並支援資料平行與 MTP 草稿模型;實驗性的 `vllm snapshot` 功能則可透過 CRIU 恢復已初始化的 TP1 引擎。
在投機解碼與 Model Runner V2(MRV2)部分,MRV2 現支援草稿模型投機解碼與自訂 logits 處理器;新增 LiLiCorr 草稿器、DFlash 非同步排程、Gemma4 的 DSpark 自適應驗證,以及 Kimi-K3 的變長解碼。大規模部署方面,新增 MoonEP 平衡 EP all2all 後端與 DeepEPv2 序列平行處理。
排程與安全性也有顯著調整:新增 `--max-num-active-seqs` 獨立限制執行中(RUNNING)的請求數量,並重構等待佇列,讓已持有 KV 區塊的請求優先排程。基於安全考量,系統預設拒絕單次請求的 `mm_processor_kwargs` 與 `media_io_kwargs` 參數,並為 prefix-cache 額外鍵值加入來源標籤以防碰撞。
此次更新包含多項破壞性變更,移除了 `tokenizer_mode="slow"`、Quark 靜默線上量化與 AllSpark INT8 W8A16 後端,並將 XPU graphs 改為預設開啟。模型支援方面,新增 DiffusionGemma 結構化生成模式、MiMo V2 MXFP4 MoE,並支援 AMD-Quark 混合精度 DeepSeek-V4.1-Flash-MXFP4 檢查點。官方已釋出支援 CUDA 13.0、12.9、ROCm、XPU 與 CPU 的 Python Wheels 及 Docker 映像檔。
讀原始報導背景
FlashMLA 是由 DeepSeek 開發的最佳化注意力核心(attention kernels)函式庫,主要用於驅動 DeepSeek-V3 與 DeepSeek-V3.2-Exp 模型。DeepGEMM 則是統一且高效能的張量核心函式庫,支援 FP8、FP4 與 BF16 等現代大型語言模型所需的矩陣運算。
這則事件的發展
來源
本期分類