研究與評測
Apple 發表 TS-DFM 離散流匹配蒸餾技術:8 步推論速度提升 128 倍,困惑度降 32%
Apple ML一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Apple ML 發表關於離散流匹配(Discrete Flow Matching)蒸餾技術的最新論文,提出 Trajectory-Shaped Discrete Flow Matching(TS-DFM)方法。傳統蒸餾的訓練軌跡由盲目的隨機跳躍組成,早期的錯誤決策會傳播並導致學生模型表現不佳;TS-DFM 則在訓練階段引入輕量級的「能量指南針(energy compass)」,於每個中點評估並選擇最連貫的候選延續,且完全不增加推論成本。在 170M 參數的語言建模測試中,僅需 8 步推論的 TS-DFM 學生模型,其困惑度(perplexity)比 1,024 步的教師模型低 32%,生成速度提升 128 倍。該方法達到了測試基準中最佳的離散生成困惑度,甚至超越使用 6 倍訓練資料或 5 倍參數規模的其他模型。
讀原始報導背景
知識蒸餾(Knowledge distillation)是一種將大型模型的知識轉移到較小模型中的技術。而 Discrete Flow Matching 則是一種透過在來源與目標分佈之間進行插值來生成資料的演算法,目前已可應用於文字與影像等多種模態。
來源
本期分類