研究與評測
TOPL強化分布外忠實生成
HF Daily Papers
研究提出 Token-Level Off-Policy Labeling(TOPL),將 off-policy 後訓練重構為 token 級正確性預測任務,引導模型產生更忠實的內容。實驗顯示,TOPL 在 11 個文件摘要資料集上具備良好的分布外泛化能力,並可有效遷移至機器翻譯任務。消融研究指出 token 級學習訊號是效能關鍵,而 TOPL 訓練出的 LoRA adapters 亦可解釋為線性分類頭與 steering vectors。
讀原始報導背景
Token-Level Off-Policy Labeling(TOPL)是一種離策略後訓練框架,將語言模型對齊重新定義為逐一判斷 token 是否正確的分類任務。相較於直接要求模型重現離策略資料中的 token,TOPL 讓模型辨別好、壞 token,以引導生成並降低直接學習離策略 token 所帶來的問題。