跳到主要內容
2026-08-11 日報
開發生態

vLLM 發布 v0.27.0:全面支援 Kimi K3 與 Qwen3.5,並針對 DeepSeek-V4 進行效能最佳化

GitHub vllm-project/vllm一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

vLLM 專案正式發布 v0.27.0 版本,帶來多項新模型支援與底層效能升級。新版全面支援 Kimi K3,包含核心模型檔案、Python 與 Rust 前端、AttnRes、DeepGEMM 支援、壓縮張量量化,以及共享專家分片選項。同步新增支援 Qwen3.5(純文字密集與 MoE 模型)、K-EXAONE-2.0-750B-A37B、VaultGemma 及 jina-embeddings-v5-text-nano。 針對 DeepSeek-V4,新版進行了大幅效能推進:包含序列平行處理、跳過空 c128 啟動帶來約 2 倍核心改進、跳過不必要的 topk/router 降低 3.4% 端到端首字延遲(TTFT)、工作區重用降低 3.9% TTFT,並在 PP 緩衝區節省 448 MiB GPU 記憶體。 在環境與硬體支援方面,系統升級至 PyTorch 2.13.0、torchvision 0.28.0 與 Triton 3.7.1,官方註明此為破壞性環境變更。硬體端深化了 SM100 上的 FlashAttention 4 整合,支援 FP8 KV cache 與 headdim-256,並初步啟用 NVIDIA Rubin (sm_107) 目標架構與 ROCm gfx1250。 引擎核心部分,新增 JIT 預熱基礎設施與 runner-owned Triton 核心預熱,消除了首次請求的編譯停頓。Model Runner V2 擴展至非生成式工作負載,支援 encoder-only attention、嵌入與分類的序列池化。此外,Rust 前端新增了 gRPC 控制平面,提供引擎感知的健康回報與伺服器發現功能。
讀原始報導

背景

vLLM 是一個用於大型語言模型推論與服務的開源軟體框架,最初由加州大學柏克萊分校的 Sky Computing Lab 開發。該專案以 PagedAttention 記憶體管理技術為核心,提供高吞吐量與高效率的記憶體使用,並支援連續批次處理與分散式推論等功能。

來源

本期分類