跳到主要內容
2026-09-10 日報
開發生態

vLLM 發布 v0.29.0:預設啟用 MRV2,並支援 Hy4-preview、Qwen3.8 與 Kimi K3 等未曝光模型

GitHub vllm-project/vllm一手來源
已查原文 · 6 項主張

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

經查證 v0.29.0 release notes,報導中的各項宣稱均獲支持。原文證實了 Model Runner V2 成為預設,且新增支援 Hy4-preview、Qwen3.8-Flash-Next 及 NemotronH 等多款模型。同時針對 Kimi K3 與 DeepSeek V4 等提供 SM100 調度及 MegaMoE 融合,並加入 sharded_rdt P2P 同步、FlashInfer all-reduce 預設啟用與 TTFT 延遲改善。此外,確實移除了舊架構並棄用舊版 api_server 指令。

vLLM 發布 v0.29.0 版本,預設全面啟用 Model Runner V2 (MRV2)。

原文指出發布新版本,並已將 Model Runner V2 設為所有模型的預設。

Model Runner V2

查看原始出處

新增支援的模型包含騰訊 770B/49B 活躍參數的 MoE 模型 Hy4-preview、Qwen3.8-Flash-Next、NemotronH_Omni_Reasoning_V3,以及 Kimi K3 NVFP4 檢查點。

原文的 New models 清單中確實包含了 Hy4-preview、Qwen3.8-Flash-Next、NemotronH_Omni_Reasoning_V3 及 Kimi K3 等未曝光模型。

Hy4-preview

查看原始出處

Qwen3.8-Flash-Next

查看原始出處

NemotronH_Omni_Reasoning_V3

查看原始出處

新版針對 Kimi K3 與 DeepSeek V4 進行效能最佳化,包含在 SM100 上調度 Hopper 低延遲 GEMM,以及將 DeepSeek V4 共享專家融合進 MegaMoE。

原文記載了對這兩款模型的最佳化,包含在 SM100 上調度 GEMM 及將專家融合進 MegaMoE。

on SM100

查看原始出處

into MegaMoE

查看原始出處

投機解碼新增支援 GLM-5.2 與 DeepSeek V4 的稀疏 MLA,並加入 sharded_rdt P2P 後端以支援 RL 權重同步。

原文提到支援前述模型的稀疏 MLA,並且在權重同步部分加入了 sharded_rdt P2P 後端。

sharded_rdt P2P

查看原始出處

Mamba 前綴快取可提升 9% 至 25% 的首字延遲(TTFT),且 TP CUDA 群組預設啟用 FlashInfer all-reduce。

原文說明前綴快取帶來 9% 至 25% 的 TTFT 改善,且預設啟用了 FlashInfer all-reduce。

9%-25% TTFT

查看原始出處

FlashInfer all-reduce

查看原始出處

本次更新移除了十種已棄用的模型架構,並將 python -m vllm.entrypoints.openai.api_server 棄用,改由 vllm serve 取代。

原文的重大變更中提到移除舊模型架構,並明示 api_server 已被棄用。

api_server deprecated

查看原始出處
vLLM 發布 v0.29.0 版本,預設全面啟用 Model Runner V2 (MRV2),並支援多款尚未正式曝光的前沿模型。 新增支援的模型包含騰訊 770B/49B 活躍參數的 MoE 模型 Hy4-preview、Qwen3.8-Flash-Next、NemotronH_Omni_Reasoning_V3,以及 Kimi K3 NVFP4 檢查點。 新版針對 Kimi K3 與 DeepSeek V4 進行效能最佳化,包含在 SM100 上調度 Hopper 低延遲 GEMM,以及將 DeepSeek V4 共享專家融合進 MegaMoE。 投機解碼新增支援 GLM-5.2 與 DeepSeek V4 的稀疏 MLA,並加入 `sharded_rdt` P2P 後端以支援 RL 權重同步。 Mamba 前綴快取可提升 9% 至 25% 的首字延遲(TTFT),且 TP CUDA 群組預設啟用 FlashInfer all-reduce。 此外,本次更新移除了十種已棄用的模型架構,並將 `python -m vllm.entrypoints.openai.api_server` 棄用,改由 `vllm serve` 取代。
讀原始報導

背景

EAGLE(Extrapolation Algorithm for Greater Language-model Efficiency)是一種用於大型語言模型快速解碼的推測採樣技術,透過特徵層級的自迴歸來提升推論效率。此外,更新中提及的 NVFP4 則是一種針對特定硬體設計的資料格式。

這則事件的發展

  1. 2026-08-27vLLM 發布 v0.28.0:深度最佳化 Kimi-K3 與 DeepSeek V4 推論,並支援磁碟 KV 快取卸載

來源

本期分類