跳到主要內容
主題

vLLM

15 則報導橫跨 142026-07-27
2026-09-20Reddit r/LocalLLaMA

網友分享 Gemma 4 31B 推理速度最佳化方法,透過分支 vLLM 寫入自訂修補程式提升 TPS

2026-09-10Reddit r/LocalLLaMA

網友實測以 10 至 12 張 RTX 3090 運行 285B DeepSeek-V4-Flash-Vision-Exp,解碼速度最高達 120 tok/s

2026-09-10GitHub vllm-project/vllm

vLLM 發布 v0.29.0:預設啟用 MRV2,並支援 Hy4-preview、Qwen3.8 與 Kimi K3 等未曝光模型

2026-09-03HF Daily Papers

Salesforce 發表 Random Attention:保留提示詞並隨機丟棄 KV Cache,推理吞吐量提升 32-43%

2026-08-30量子位

實測揭露本地部署 LLM 效能衰退元兇:推理軟體堆疊差異導致長文本 Token 翻轉,NVIDIA NVFP4 錯誤率近半

2026-08-29Reddit r/LocalLLaMA

Tontaube 發布 2.9B 開源 TTS 模型 TontaubeV1:首包延遲 200ms,支援長文本與零樣本語音複製

2026-08-27GitHub vllm-project/vllm

vLLM 發布 v0.28.0:深度最佳化 Kimi-K3 與 DeepSeek V4 推論,並支援磁碟 KV 快取卸載

2026-08-25Hacker News

研究指 LLM 可透過推論引擎漏洞控制主機,vLLM 曾爆出 CVE-2025-9141 任意程式碼執行漏洞

2026-08-22Hacker News

開源 Qwen3-TTS 1.7B 實作:單張 H100 達成 10 RPS 下首音訊延遲低於 50ms,每百萬字元成本約 2 美元

2026-08-18InfoQ 中國

Netflix 詳述內部 LLM 服務平台:結合 Triton 與 vLLM,並自建邏輯解決受限解碼狀態同步問題

2026-08-14GitHub Trending (python)

Zero-Shot 語音生成模型 IndexTTS 發布 2.5 版:支援 5 種語言、升級音素與語速控制,並支援 vLLM 部署

2026-08-11GitHub vllm-project/vllm

vLLM 發布 v0.27.0:全面支援 Kimi K3 與 Qwen3.5,並針對 DeepSeek-V4 進行效能最佳化

2026-08-07Reddit r/LocalLLaMA

開發者將 vLLM 移植為 C++20 版本 vllm.cpp:免 Python 依賴,編譯體積僅 66 MiB

2026-07-28X @Xianbao_QIAN

Kimi K3傳首日支援vLLM

2026-07-27GitHub vllm-project/vllm

vLLM 0.26.0 發布