研究與評測
新量化修復技術 Quantization-Aware Healing 發布:60B 4-bit 模型在 7 項基準測試擊敗自身全精度版本
HuggingFace Blog綜合 2 家報導一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

最新論文提出 Quantization-Aware Healing(QAH)量化修復技術,解決模型經過結構壓縮與量化後的效能恢復問題。研究團隊將 GPT-OSS 120B 模型壓縮至 60B 參數並量化為 MXFP4(4-bit)格式,結果顯示該 4-bit 模型在 9 項基準測試中有 7 項擊敗了自身的 60B bfloat16 全精度版本,打破了量化模型效能必然低於原始 16-bit 模型的常規。
傳統的量化感知訓練(QAT)需要重新執行高成本的微調過程,而量化感知蒸餾(QAD)在模型經過結構壓縮(如減少層數或注意力頭)後,只能依賴已降級的恢復檢查點作為教師模型,限制了效能上限。QAH 的核心差異在於:它直接從壓縮前的原始 120B 全精度模型進行知識蒸餾。
在 QAH 架構下,教師模型(120B 全精度)與學生模型(60B MXFP4)無需共享相同架構。學生模型不使用硬標籤(hard labels),而是透過對數幾率(logits)的 KL 散度(KL-divergence)來匹配教師模型的輸出分佈。這使得量化階段轉變為第二次完整的蒸餾過程,讓 4-bit 模型能吸收先前恢復階段未能轉移的資訊。此外,由於 KL 蒸餾將學生模型綁定於固定的教師分佈,避免了傳統交叉熵任務損失導致的訓練不穩定與偏移問題。
為支援長文本,QAH 採用記憶體高效的分塊 KL 散度損失函數,每次僅計算序列的一個切片,無需實例化完整的詞彙-序列網格,從而能在固定的 GPU 記憶體預算內完成高達 32k 詞元的修復。
測試結果顯示,60B MXFP4 (QAH) 模型在多項指標超越 60B bfloat16 版本:長文本推理(AA-LCR)提升 7.4 分、數學(AIME 2025)提升 5.6 分、代理程式編寫(Aider)提升 2.7 分。該模型僅在 MMLU-Pro 與 SciCode 兩項測試中以不到 1.5 分的微小差距落後全精度版本,且最大的效能增幅正好落在通常受壓縮破壞最嚴重的能力上。
讀原始報導背景
新聞中提到的 MXFP4 是一種基於區塊浮點(Block floating point, BFP)的格式。該技術讓一組尾數共用單一指數,藉此在硬體中節省空間,並提供接近浮點數的運算能力。