跳到主要內容
2026-09-17 日報
研究與評測

新研究提出 BITCOS 佈局打破三元 LLM 1.58-bit 限制,最低達 1.485 bits/weight 並提升 GPU 推論速度達 1.27 倍

Hacker News單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

一篇提交至 arXiv 的最新論文提出名為 BITCOS 的分佈自適應佈局,旨在打破三元大型語言模型(Ternary LLM)的 1.58-bit 儲存限制。傳統三元模型權重為 {-1, 0, +1},理論極限約為 1.585 bits/weight,而現行主流的 5-trit 封裝(將 5 個三元權重塞入 1 byte)因實務上的二進位分組大小,實際佔用達 1.625 bits/weight,且預設三種符號出現機率相等。 研究團隊分析 29 款三元 LLM 後發現,零權重(zeros)的佔比最高可達 51.5%。基於此特性,BITCOS 採用密集存在位元圖(dense presence bitmap)加上壓縮符號向量(compacted sign vector)的設計,使其儲存成本降至 $2 - z$ bits/weight($z$ 為零權重密度)。 實測顯示,BITCOS 在 29 款模型中有 26 款的儲存效率優於 5-trit 封裝,在最稀疏的模型上更達到 1.485 bits/weight。在效能方面,該佈局針對 AVX-512、AVX2 與 Intel Xe2 GPU 提供最佳化解包(unpacking)序列,矩陣向量乘法核心效能提升達 1.28 倍;在 5 種不同平台(包含客戶端與伺服器 CPU、內建與獨立 Xe2 GPU)的端到端 LLM 推論測試中,CPU 解碼吞吐量最高提升 1.18 倍,GPU 則提升達 1.27 倍。
讀原始報導

社群討論

社群讚賞該研究利用權重有 51% 為 0 的特性,成功將資訊熵從 1.58 bits 壓至 1.48 bits,並看好其未來在專用硬體上的高效率。部分網友質疑三進位量化不如向量量化等 PTQ 方法,且擔憂極低位元難以維持無損精度(如目前動態 fp4 仍無法完全無損)。但支持者反駁,三進位 LLM 的核心優勢是將運算簡化為加減法以提升速度,而不僅是為了節省傳輸頻寬。

本期分類