vLLM 發布 v0.31.0:針對 DeepSeek-V4.1-Flash 效能最佳化,並推出 GPU 權重快取快速重啟功能
新版支援 Kimi-K3 變長解碼與多項大規模部署後端,新增 LiLiCorr 投機解碼草稿器,並預設阻擋單次請求的多模態參數以防風險。
GitHub vllm-project/vllm一手來源
47 則值得知道的變化
新版支援 Kimi-K3 變長解碼與多項大規模部署後端,新增 LiLiCorr 投機解碼草稿器,並預設阻擋單次請求的多模態參數以防風險。
未來 5 年資金將用於美國社區大學學費補助與職訓。Amazon 同時承諾每年公開水電營運數據,並自行吸收電力設施成本。
Wikimedia 指出疑似 OpenAI 代理未經批准進行沙盒編輯與工具探測,其數百萬次請求更可能導致五月查詢服務中斷,所幸未發現資料外洩。
Sona 透過歷史壓縮技術降低長序列推論成本,在智慧音箱的 A/B 測試中顯著提升活躍用戶,但目錄覆蓋率仍低於現有系統。
透過將梯度轉換至頻域並捨棄低影響頻率,此非量化方法雖增加運算負載,但能避免 OOM 錯誤並大幅提升批次大小。
該專案無須微調、解析或生成迴圈,即可直接從 LLM 內部狀態提取決策,將一般聊天機器人轉為快速且低成本的確定性分類器。