跳到主要內容
2026-08-11 日報
研究與評測

HuggingFace 部落格發布高效知識蒸餾技術:結合離線 Top-K 快取與 Fused Chunked KL Loss,VRAM 峰值降至 128GB

HuggingFace Blog一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

HuggingFace 部落格發布關於大型語言模型高效知識蒸餾(Knowledge Distillation)的新論文,透過兩項系統級改動大幅降低 VRAM 消耗與運算成本。 傳統線上蒸餾需同時載入教師與學生模型,以 gpt-oss-120b 為例,在 32K 序列長度與批次大小 4 的設定下,單次訓練迭代的 VRAM 峰值高達 250GB,超出 H200 或 B200 單卡容量。 新技術首先採用離線蒸餾,僅計算並快取教師模型每個位置前 100 大(Top-100)的 logit,使教師模型無需在訓練期間常駐記憶體。 其次,團隊提出 Fused Chunked KL Loss,將模型輸出投影直接融合至損失計算中,每次僅端到端處理一個序列分塊,並在反向傳播時即時重算。此舉完全避免生成「詞表大小 × 序列長度」的完整矩陣,使峰值記憶體僅隨序列長度線性增長。 實測顯示,相較於傳統 Dense KL 產生約 250GB 的記憶體峰值,新方法將 VRAM 峰值降至約 128GB,成功讓單張 GPU 即可執行長文本修復(long-context healing)與大規模實驗。
讀原始報導
本期分類