研究與評測
新研究提出 OLIVE 在線模型蒸餾法:由學生生成前綴交由教師接續,ScienceWorld 表現勝離線 SFT 13%
HF Daily Papers一手來源
核實資料不足
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
本次未取得足夠原文證據
新研究提出名為 OLIVE(OnLine InterVEntion)的在線模型蒸餾方法。其運作機制為:在每次疊代中,由演進中的學生模型生成新前綴,接著由教師模型進行自迴歸接續生成,最後學生模型利用教師生成的 token 計算交叉熵來進行更新。
該設計解決了現有蒸餾方法的限制,包含離線監督式微調(SFT)中的序列共變異數偏移、token 級別在線策略蒸餾(OPD)中前綴失敗導致的監督碎片化,且無需存取教師模型的 token 機率。
數據顯示,OLIVE 在相近的 GPU 運算成本下,推理表現優於 OPD;其非同步實作進一步將總訓練時間縮短 23.8%。在複雜推理與代理任務中,OLIVE 於相同訓練預算下穩定超越現有蒸餾方法,並能在離線蒸餾達到瓶頸後持續提升,同時保留學生模型的通用能力與可塑性。實測顯示,僅使用 GPT-5.4-mini 的文本進行連續訓練,OLIVE 在 ScienceWorld 的表現比同教師模型的離線 SFT 高出 13%。
讀原始報導背景
知識蒸餾(Knowledge Distillation)常被用來將大型教師模型壓縮成較小的學生模型,以降低推論成本與記憶體佔用。然而,現有針對自迴歸模型的蒸餾方法,常面臨訓練時的輸出序列與學生模型在推論時實際生成的序列存在分佈不一致(distribution mismatch)的問題。
來源
本期分類