vLLM 發布 v0.29.0:預設啟用 MRV2,並支援 Hy4-preview、Qwen3.8 與 Kimi K3 等未曝光模型
已查原文 · 6 項主張
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
經查證 v0.29.0 release notes,報導中的各項宣稱均獲支持。原文證實了 Model Runner V2 成為預設,且新增支援 Hy4-preview、Qwen3.8-Flash-Next 及 NemotronH 等多款模型。同時針對 Kimi K3 與 DeepSeek V4 等提供 SM100 調度及 MegaMoE 融合,並加入 sharded_rdt P2P 同步、FlashInfer all-reduce 預設啟用與 TTFT 延遲改善。此外,確實移除了舊架構並棄用舊版 api_server 指令。
vLLM 發布 v0.29.0 版本,預設全面啟用 Model Runner V2 (MRV2)。
原文指出發布新版本,並已將 Model Runner V2 設為所有模型的預設。
Model Runner V2
查看原始出處
新增支援的模型包含騰訊 770B/49B 活躍參數的 MoE 模型 Hy4-preview、Qwen3.8-Flash-Next、NemotronH_Omni_Reasoning_V3,以及 Kimi K3 NVFP4 檢查點。
原文的 New models 清單中確實包含了 Hy4-preview、Qwen3.8-Flash-Next、NemotronH_Omni_Reasoning_V3 及 Kimi K3 等未曝光模型。
Hy4-preview
查看原始出處
Qwen3.8-Flash-Next
查看原始出處
NemotronH_Omni_Reasoning_V3
查看原始出處
新版針對 Kimi K3 與 DeepSeek V4 進行效能最佳化,包含在 SM100 上調度 Hopper 低延遲 GEMM,以及將 DeepSeek V4 共享專家融合進 MegaMoE。
原文記載了對這兩款模型的最佳化,包含在 SM100 上調度 GEMM 及將專家融合進 MegaMoE。
on SM100
查看原始出處
into MegaMoE
查看原始出處
投機解碼新增支援 GLM-5.2 與 DeepSeek V4 的稀疏 MLA,並加入 sharded_rdt P2P 後端以支援 RL 權重同步。
原文提到支援前述模型的稀疏 MLA,並且在權重同步部分加入了 sharded_rdt P2P 後端。
sharded_rdt P2P
查看原始出處
Mamba 前綴快取可提升 9% 至 25% 的首字延遲(TTFT),且 TP CUDA 群組預設啟用 FlashInfer all-reduce。
原文說明前綴快取帶來 9% 至 25% 的 TTFT 改善,且預設啟用了 FlashInfer all-reduce。
9%-25% TTFT
查看原始出處
FlashInfer all-reduce
查看原始出處
本次更新移除了十種已棄用的模型架構,並將 python -m vllm.entrypoints.openai.api_server 棄用,改由 vllm serve 取代。
原文的重大變更中提到移除舊模型架構,並明示 api_server 已被棄用。
api_server deprecated
查看原始出處
背景
EAGLE(Extrapolation Algorithm for Greater Language-model Efficiency)是一種用於大型語言模型快速解碼的推測採樣技術,透過特徵層級的自迴歸來提升推論效率。此外,更新中提及的 NVFP4 則是一種針對特定硬體設計的資料格式。