跳到主要內容
2026-09-03 日報
研究與評測

研究指出 LLM On-Policy 蒸餾僅需單一訓練樣本即可達大部分增益,16 個樣本即匹配全資料訓練

HF Daily Papers一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

最新研究探討大型語言模型 On-Policy 蒸餾(OPD)的資料極限,發現僅需單一訓練樣本(query)即可在數百步內持續改善,並恢復全資料 OPD 的大部分效能增益。 研究測量了狀態覆蓋率,指出單一 query 在前 100 步內即可達到 71.5% 的覆蓋率;當增加至 16 個語意不同的 query 時,覆蓋率達 98.9%,效能與使用完整資料集訓練相當。此現象在多教師 OPD(MOPD)中同樣成立,且使用輕量模板或非領域的 WildChat query 進行壓力測試,也能接近真實 query 的基準。 研究結論指出,OPD 目前處於「資料過剩但演算法匱乏」(data-overfed but algorithm-starved)的狀態,模型生成的 rollouts 能快速提供廣泛的監督訊號,但學生模型吸收對齊的速度卻相當緩慢。相關程式碼已於 GitHub 開源。
讀原始報導

背景

知識蒸餾(Knowledge distillation)是將大型模型的知識轉移到較小模型中的過程。其中,On-policy distillation(OPD)讓學生模型自行生成內容,再由教師模型對每個 token 進行評分,但過去相關研究的結果往往存在極大差異。

來源

本期分類