開發生態
開發者將 vLLM 移植為 C++20 版本 vllm.cpp:免 Python 依賴,編譯體積僅 66 MiB
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 社群報導,開發者推出非官方的 vLLM C++20 移植版本「vllm.cpp」,旨在解決原版高達 9.1 GiB 的 Python 虛擬環境依賴與潛在的供應鏈安全問題。該專案從頭編寫推論服務堆疊,編譯後的二進位檔僅 66 MiB,且執行時完全不依賴 Python 或 PyTorch。
功能方面,vllm.cpp 支援連續批次處理、區塊分頁 KV(Block-paged KV)、自動前綴快取、推測解碼,並內建相容 OpenAI 格式的伺服器。為確保準確性,該專案在約 25 種模型架構上,與原版 vLLM 進行逐個 Token(token-for-token)的比對驗證。
效能實測顯示,在 DGX Spark 上執行 Qwen3.6-27B NVFP4 模型,vllm.cpp 的高併發吞吐量與原版 vLLM 幾乎持平(差距在 1.7% 內);但在 GPU 記憶體佔用上,由於改採依工作負載動態分配而非預先保留,峰值從 70,531 MiB 降至 40,996 MiB。此外,在 CPU aarch64 環境下,其預填充(Prefill)速度為 llama.cpp 的 1.18 倍;推測解碼實測可將 MTP 速度從 9.97 提升至 15.10 tok/s。
該專案採 Apache 2.0 授權,目前支援 safetensors 與 GGUF 格式(含 NVFP4、fp8、bf16 及多種量化),相容 CUDA(sm_80 至 sm_121a)、CPU、Metal 與部分 Vulkan 環境,但尚未支援實體多 GPU、ROCm 以及透過 HTTP API 呼叫多模態功能。
讀原始報導背景
vLLM 是一個開源的大型語言模型(LLM)推論與伺服框架,最初由加州大學柏克萊分校的 Sky Computing Lab 開發。其核心技術為 PagedAttention,這是一種針對 Transformer 鍵值快取(KV cache)的記憶體管理方法,並支援連續批次處理與量化等功能。
這則事件的發展
來源
本期分類