研究與評測
llama.cpp 提交自適應 MTP 模式 PR,動態調整預測深度使程式碼回溯最高提速 100%
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 社群開發者貼文指出,llama.cpp 近期提交了一項引入自適應 MTP(Multi-Token Prediction)模式的 PR(#27210)。該功能透過計數型狀態機動態決定 MTP 深度,讓伺服器自動最佳化設定,免去使用者手動調整的困擾。
據開發者實測,與固定深度 MTP=3 相比,新模式在生成程式碼時速度提升 10-15%;若從思考階段回溯程式碼,提速可達 50% 以上;當模型選擇從記憶中重寫整份檔案時,生成速度最高可提升 100%。在回溯一般文本時,速度也有 20-30% 的增幅。然而,在處理難以預測的複雜文本時,效能會微降約 3%;且若設定較高的 Temperature 導致輸出不可預測性增加,自適應模式的優勢也會減弱。
開發者建議的啟動參數為 `--spec-type draft-mtp-adaptive --spec-draft-n-max 12`,允許深度在 3 到 12 之間動態調整,並可透過 `--spec-draft-n-min-adaptive` 更改預設的最低深度 3。
讀原始報導背景
llama.cpp 是一個以 C/C++ 撰寫的開源高效能推論引擎,主要用於執行 GGUF 格式的大型語言模型,被廣泛視為本機端推論工具的標準。而多詞元預測(Multi-Token Prediction, MTP)則是一種讓模型能同時預測多個未來詞元的技術,藉此提升生成效能與推論速度。
這則事件的發展
來源
相關主題