跳到主要內容
2026-08-20 日報
研究與評測

ETH Zürich 秦浩桐發表 BiLLM 1-bit 量化技術,單卡半小時將 LLaMA-2 70B 壓縮至 1.08-bit

AI 科技評論單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,ETH Zürich 博士後研究員秦浩桐於 IJCAI 2026 大會發表極限量化技術演講,探討透過後訓練量化(PTQ)將大語言模型壓縮至 1-bit 與 2-bit。 針對 1-bit 量化,其發布的 BiLLM 利用權重敏感度的「長尾效應」與「鐘形分布」進行解耦處理,保留集中於少數通道的 Top-1 結構化敏感權重,其餘權重則依閾值分組量化。BiLLM 無需重新訓練,單張 GPU 耗時約半小時即可完成;在平均每權重 1.08-bit 的條件下,LLaMA-2 70B 於 WikiText-2 測試集達成 8.41 的困惑度(Perplexity),並維持文本連貫性。 針對 2-bit 量化,原文稱秦浩桐團隊推出 SqueezeLLM,以 128 個權重為一組進行動態比特分配與敏感度加權校準,將 LLaMA 7B 的 2-bit 量化困惑度拉回可用區間。然而補充資料顯示,SqueezeLLM 論文實由 Sehoon Kim 等 8 人撰寫並發表於 ICML 2024,採用 Dense-and-Sparse Quantization 方法,與原文的團隊歸屬說法存在分歧。 秦浩桐指出極低比特量化仍面臨三大挑戰:低於 2-bit 時複雜指令遵循的隱性折損、現有 GPU 缺乏 INT2 或 1-bit 原生硬體通路,以及激活值(Activation)與 KV Cache 的量化難題。
讀原始報導

背景

SqueezeLLM 是一種後訓練量化(Post-Training Quantization)框架,旨在讓大型語言模型能更有效率地運行。該框架導入了名為「密集與稀疏量化(Dense-and-Sparse Quantization)」的新方法,其研究成果已於 ICML 2024 發表。

來源

本期分類