跳到主要內容
2026-08-31 日報
研究與評測

llama.cpp 提交 NUMA 鏡像權重 PR,以雙倍記憶體換取雙路 CPU 解碼效能最高提升 137%

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據社群開發者提交至 llama.cpp 的 PR(#27986)指出,透過實作 `--numa mirror` 策略,可顯著提升雙路 CPU 的本地解碼效能。該方案啟用 `ggml-cpu.h` 中的 `GGML_NUMA_STRATEGY_MIRROR`,在每個 NUMA 節點上保留一份完整的模型權重副本,讓執行緒僅從本地節點讀取,藉此避開跨插槽(cross-socket)的記憶體頻寬瓶頸,代價是需要消耗兩倍的記憶體(RAM)。 據開發者在雙路 EPYC 7532 處理器(本地讀取 137 GB/s、跨插槽 47.7 GB/s)的實測數據,相較於原有的 `--numa distribute`,DeepSeek-V4-Flash Q8(151 GiB)解碼效能從 10.96 提升至 17.93(+64%)。GLM-5.2 Q3_K_XL(319 GiB)提升 71%(4.97 至 8.49),而 gemma-4-31B Q4_0 dense 在純 CPU 解碼下更提升達 137%(3.32 至 7.88)。
讀原始報導

背景

「llama.cpp」是一個用於大型語言模型推論的開源 C/C++ 軟體函式庫,與通用張量函式庫 GGML 共同開發。該專案目前被廣泛視為執行本機端模型推論的核心標準。

這則事件的發展

  1. 2026-08-26網友開發 Llama.cpp 自適應推測分支,稱 Qwen3.8 推論速度最高提升 50%
  2. 2026-08-23Llama.cpp 釋出 0.2.0 版本,同步提供 b10566 預先編譯檔案
  3. 2026-08-22據報 llama.cpp 提交 PR 支援多模態 MoE 模型 dots3-note,具備 280B 參數與 512K 上下文
  4. 2026-08-20llama.cpp 引入 DFlash2 投機解碼,Qwen 3.8 27B 本地推論速度最高提升 3 倍達 140 tok/s
  5. 2026-08-18llama.cpp 提交自適應 MTP 模式 PR,動態調整預測深度使程式碼回溯最高提速 100%

來源

本期分類