跳到主要內容
2026-08-26 日報
研究與評測

網友開發 Llama.cpp 自適應推測分支,稱 Qwen3.8 推論速度最高提升 50%

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit r/LocalLLaMA 社群網友分享,一款 Llama.cpp 分支版本引入了「自適應推測」(adaptive speculation)功能,旨在提升 Qwen3.8 等模型的推論效能。原版 Llama.cpp 的 MTP 與 DFlash 推測生成僅支援單一固定數值,而該分支允許使用者設定建議 token 數的最小值與最大值,由引擎依據內容類型自動動態調整。開發者稱,此機制相較於主線版本可將 token 生成速度提升最高 50%;在 Strix Halo 處理器上測試 Qwen3.8 生成結構化內容時,速度從 44 t/s 提升至 65 t/s。
讀原始報導

背景

推測解碼(Speculative decoding)是一種透過較快的小型草稿模型預先生成內容,再交由目標大型語言模型進行平行驗證的技術,藉此降低推論延遲並提升 GPU 使用率。其中,DFlash 是一種專為推測解碼設計的輕量級區塊擴散模型(block diffusion model),能提供高效率的平行草稿生成,解決傳統推測解碼仍依賴自迴歸生成的問題。

這則事件的發展

  1. 2026-08-23Llama.cpp 釋出 0.2.0 版本,同步提供 b10566 預先編譯檔案
  2. 2026-08-22據報 llama.cpp 提交 PR 支援多模態 MoE 模型 dots3-note,具備 280B 參數與 512K 上下文
  3. 2026-08-20llama.cpp 引入 DFlash2 投機解碼,Qwen 3.8 27B 本地推論速度最高提升 3 倍達 140 tok/s
  4. 2026-08-18llama.cpp 提交自適應 MTP 模式 PR,動態調整預測深度使程式碼回溯最高提速 100%

來源

本期分類