研究與評測
llama.cpp 引入 DFlash2 投機解碼,Qwen 3.8 27B 本地推論速度最高提升 3 倍達 140 tok/s
Reddit r/LocalLLaMA綜合 2 家報導單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
llama.cpp 透過 PR #27342 引入 DFlash2 投機解碼技術,結合 Inco 為 Qwen 3.8 27B 發布的專用區塊草稿模型(block drafter),大幅提升本地推論效能。社群實測顯示,在 RTX 6000 上,生成速度中位數從基準的 47.4 tok/s 提升至 140.6 tok/s(優於 MTP 的 114.7 tok/s),平均加速約 3 倍,但依任務不同最低增幅約 1.5 倍。另一項基於 RTX 3090(限電 250W)的高度最佳化測試指出,單一請求速度可達 138 tok/s,64 併發下達 942 tok/s;最顯著的改善在於長上下文互動,長對話的後續輪次耗時從約 23 秒驟降至約 1 秒。
讀原始報導背景
llama.cpp 是一個開源的 C/C++ 推論引擎,廣泛用於執行大型語言模型。DFlash2 則是一種專為推測解碼(speculative decoding)設計的草稿模型(draft model),它並非獨立的語言模型,而是負責預先生成 token 交由目標模型驗證,藉此提升生成速度。