HuggingFace 部落格發布高效知識蒸餾技術:結合離線 Top-K 快取與 Fused Chunked KL Loss,VRAM 峰值降至 128GB
透過快取教師模型前 100 大 logit 並分塊計算損失,新方法避免生成完整詞表矩陣,使單張 H200 即可執行長文本蒸餾。
HuggingFace Blog一手來源
57 則值得知道的變化
透過快取教師模型前 100 大 logit 並分塊計算損失,新方法避免生成完整詞表矩陣,使單張 H200 即可執行長文本蒸餾。
該實驗室於今年 5 月內部成立,旨在解決物理 AI 在資料、認知與行動間的斷裂,將聚焦大模型演算法、仿真與 AI Infra 三大方向。
分析推測 Opus 4.7 後續模型共用 2025 年底預訓練基準點,且測試顯示各實驗室皆大量使用舊版模型輸出訓練新模型。