研究與評測
網友開發 Llama.cpp 自適應推測分支,稱 Qwen3.8 推論速度最高提升 50%
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit r/LocalLLaMA 社群網友分享,一款 Llama.cpp 分支版本引入了「自適應推測」(adaptive speculation)功能,旨在提升 Qwen3.8 等模型的推論效能。原版 Llama.cpp 的 MTP 與 DFlash 推測生成僅支援單一固定數值,而該分支允許使用者設定建議 token 數的最小值與最大值,由引擎依據內容類型自動動態調整。開發者稱,此機制相較於主線版本可將 token 生成速度提升最高 50%;在 Strix Halo 處理器上測試 Qwen3.8 生成結構化內容時,速度從 44 t/s 提升至 65 t/s。
讀原始報導背景
推測解碼(Speculative decoding)是一種透過較快的小型草稿模型預先生成內容,再交由目標大型語言模型進行平行驗證的技術,藉此降低推論延遲並提升 GPU 使用率。其中,DFlash 是一種專為推測解碼設計的輕量級區塊擴散模型(block diffusion model),能提供高效率的平行草稿生成,解決傳統推測解碼仍依賴自迴歸生成的問題。