開發生態
社群釋出 llama.cpp 修補程式修正 MTP 記憶體高估,AMD 雙卡執行 Qwen 27B 上下文從 64K 提升至 149K
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit r/LocalLLaMA 社群開發者分享,一項針對 llama.cpp 的非官方修補程式成功解決了 MTP 記憶體高估問題,大幅提升 AMD GPU 上的可用上下文長度。
開發者指出,llama.cpp 在 auto-fit 階段會高估 MTP 運算緩衝區與排程器所需的記憶體,導致大量原本可用的上下文空間被浪費。該修補程式阻止系統基於膨脹的估算值限縮上下文。
實測數據顯示(基於 llama.cpp commit 7bd8282 與 ROCm 7.14,執行 Qwen 27B 模型):
- 在單張 16GB GPU 執行 IQ4_XS 量化版本:ROCm 後端的上下文從 19.4K 增至 76K;Vulkan 後端從 68.3K 升至 78.5K。
- 在 16GB + 12GB 雙 GPU 執行 Q6_K_L 量化版本:ROCm 後端從 64.2K 提升至 149.2K;Vulkan 後端從 68.8K 提升至 151.2K。
開發者補充,雖然 Vulkan 後端能節省較多顯示記憶體(vRAM),但 ROCm 在長工作階段中具備近乎翻倍的 prefill 效能。套用此修補程式後,使用雙 GPU 搭配 ROCm 後端進行層分割(layer splitting)將因上下文長度大增而更具效益。
讀原始報導背景
ROCm 是 AMD 專為 GPU 程式設計所開發的開源軟體堆疊。在執行如 Qwen 27B 等模型時,開發者常透過 `llama.cpp` 搭配 ROCm 或 Vulkan 進行推論,以平衡記憶體消耗與運算效能。
來源
本期分類