開發生態
llama.cpp 提交新 PR 最佳化 x86 CPU,Q2_0 推論速度提升達 3.6 倍
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 社群 r/LocalLLaMA 討論,llama.cpp 的一項 PR(#26348)為 Q2_0 × Q8_0 內積新增了 x86 VNNI 實作,在 x86 CPU 上的推論吞吐量提升約 3 至 3.6 倍。
在 AMD EPYC 9645(僅使用 8 核心 CPU)的實測中,1.7B 至 27B 模型的效能皆有顯著增長,其中 8B 模型的解碼速度從 2.39 tok/s 提升至 8.20 tok/s。
該實作同時解決了消費級 Intel 處理器(如 12 至 14 代)因 AVX-512 被禁用而默默錯失加速路徑的問題;在 Intel i5-13400 實測中,8B 模型 Q2_0 的解碼速度從 2.17 tok/s 提升至 6.92 tok/s。
該 PR 目前尚未合併,且效能提升僅限於 Q2_0 量化格式,不適用於 Q4 或 Q5 等其他格式。在正確性方面,作者回報核心層級的隨機比對完全一致,困惑度測試中兩版本選擇相同最高機率詞彙的比例達 99.216%。
讀原始報導背景
AVX(進階向量擴充指令集)是 Intel 與 AMD 處理器中 x86 架構的 SIMD 擴充指令集。其中 AVX-512 VNNI(向量神經網路指令)則是專為深度學習所設計的向量指令,最早於 Knights Mill 與 Ice Lake 架構中引入。
來源
本期分類