開發生態
vLLM 發布 v0.28.0:深度最佳化 Kimi-K3 與 DeepSeek V4 推論,並支援磁碟 KV 快取卸載
GitHub vllm-project/vllm一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
開源推論框架 vLLM 發布 v0.28.0 版本,重點針對 Kimi-K3 與 DeepSeek V4 進行深度效能最佳化。針對具備 2.8T 參數、原生支援視覺與 100 萬 token 脈絡長度的 Kimi-K3,新版導入解碼脈絡平行(DCP)、融合 FlashKDA 核心,以及 MegaMoE 的 SiTU 啟動支援;透過可選的共享專家分片(shared-expert sharding)技術,每張 GPU 可節省約 17 GiB 記憶體,並藉由自適應投機 token 預算讓 DSpark TTFT 效能提升約 60%。
在 DeepSeek V4 方面,稀疏 MLA 現已可端到端運行於一般解碼、MTP 與 DSpark 投機解碼,並加入 AMD Quark NVFP4 支援與推理消耗(reasoning-effort)提示映射。架構上,Model Runner V2 支援 E/P/D 解耦與權重卸載,KV 快取則新增分層機制並正式支援磁碟卸載(disk offloading)。
系統預設值方面,`max_num_batched_tokens` 從 8192 提升至 16384,Mamba 模型預設啟用前綴快取(prefix caching)。重大變更包含將 bitsandbytes 支援移至外部外掛程式,並將 Transformers 依賴版本升級至 5.15.0。此外,新版亦新增支援 Muse Glimmer、Ling 3.0 Flash、Dots3 NOTE 及 Interns2mobius 等模型。
讀原始報導背景
Kimi-K3 是由 Moonshot AI 開發的 2.8T 參數開源模型,具備高達 100 萬 token 的脈絡長度。本次 vLLM v0.28.0 的發布重點即是針對 Kimi-K3 與 DeepSeek V4 進行深度最佳化,包含為 DeepSeek V4 導入稀疏 MLA(Sparse MLA)注意力機制的端到端解碼支援。
來源
本期分類