開發生態
llama.cpp 提交 PR 為主機記憶體中的 MoE 專家新增 GPU 快取,有望提升 VRAM 不足時的推論速度
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 社群討論,開發者 am17an 為推論框架 llama.cpp 提交了 Pull Request #29887。該 PR 針對混合專家(MoE)模型,為保留在主機記憶體(host memory)中的專家(experts)新增 GPU 快取機制。對於無法將整個模型完全載入 VRAM 的硬體環境,此項最佳化有望大幅提升 MoE 模型的推論速度。
讀原始報導這則事件的發展
- 2026-10-07llama.cpp 提交 PR 引入 -sm tensor 參數,透過 RPC 支援跨機器張量平行運算
- 2026-10-06llama.cpp 釋出 v0.6.0,支援 Qwen4Exp 的 MTP 推測解碼
- 2026-10-03llama.cpp 提交 PR 支援 /v1/systemone API 與 OpenJev、Julia-1 等六款新模型
- 2026-09-28Reddit 網友宣稱 llama.cpp 的 Prompt Lookup Drafting 效能提升 42 倍
- 2026-09-27據報開發者最佳化 llama.cpp 的 prompt lookup decoding,草稿生成速度最高提升 140 倍
本期分類
相關主題