研究與評測
vLLM 0.26.0 發布
GitHub vllm-project/vllm
vLLM 0.26.0 正式發布,新增 Inkling 模型家族完整支援,並擴充推測解碼、多模態與 Transformers 5.13.0 後端。此版本強化 KV offloading 與分層次級儲存,也允許依 KV-cache 群組選擇注意力後端,有助於混合模型部署。DeepSeek-V4 跨硬體效能亦獲最佳化,部分核心效能提升 1.5 至 2 倍,端到端 TPOT 改善最高 2.94%。
讀原始報導背景
在 Transformer 中,注意力機制是主要運算瓶頸之一,自注意力分數的計算量會隨序列長度呈平方成長;FlashAttention-4 以嵌入 Python 的 CuTe-DSL 實作,編譯速度較傳統 C++ 範本方法快 20 至 30 倍。MTP 推測解碼則讓模型在一次前向運算中預測多個 token,以提升吞吐量,部分支援 MTP 的模型可透過內建預測頭運作,不必使用獨立的草稿模型。