跳到主要內容
2026-07-19 日報
研究與評測

LLM-as-a-Coach經驗學習法

HF Daily Papers
研究提出 Experiential Learning,將 LLM-as-a-Judge 轉為 LLM-as-a-Coach,從策略模型的 on-policy 回應萃取可轉移的經驗知識,再透過 on-policy 情境蒸餾寫入模型權重。論文指出,此方法在兩個策略模型家族的保留與未見開放式任務上,均優於以量表為基礎的強化學習,並展現更佳的分布外泛化能力與較少的 reward hacking。程式碼將另行公開,但內容未提供發布時間。
讀原始報導

背景

在非可驗證任務的訓練中,LLM-as-a-Judge 通常只提供單一分數作為學習訊號;LLM-as-a-Coach 則改以可引導改進的「經驗知識」提供更豐富且更具泛化能力的訊號。其採用的 on-policy context distillation,會讓學生模型先自行產生回應,再透過最小化與具備額外情境之教師模型間的反向 KL 散度進行訓練。

來源

本期分類