研究與評測
研究指演化策略(ES)在 LLM 推理後訓練具更廣覆蓋率,能解決 GRPO 熵崩潰並提升 Pass@K
HF Daily Papers一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
近期研究系統性探討演化策略(Evolution Strategies, ES)在 LLM 推理後訓練的機制,證實其能提供比 GRPO 更廣泛的推理覆蓋率。實證顯示,GRPO 在訓練中會出現熵崩潰(entropy collapse),而 ES 則能維持群體間的 Jensen-Shannon 多樣性,不僅提升 Pass@1,更能達到比 GRPO 更高的 Pass@K 表現。研究團隊為此開發了序列式的 GRPO-ES 訓練策略,結合 GRPO 在 Pass@1 的優勢與 ES 在 Pass@K 的增益。
此外,研究發現儘管 ES 會造成全模型參數大幅漂移,但任務效能增益僅來自少數較大幅度的更新。這種功能稀疏性意味著參數大變動不代表廣泛的功能改變,保留測試(held-out evaluations)也顯示其不一定會引發災難性遺忘。在超參數設計上,實驗表明較大的 LLM 在使用 ES 時需要較小的群體大小(population size)。此研究將 ES 定位為獨立的推理後訓練範式,而非僅是 GRPO 的省記憶體替代方案。
讀原始報導背景
Group Relative Policy Optimization (GRPO) 是一種主流的模型後訓練(post-training)範式,屬於直接學習策略函數而非價值函數的增強學習演算法。近期,演化策略(Evolution Strategies, ES)作為一種節省記憶體的替代方案逐漸受到關注,但其最佳化行為與優勢範圍過去較少被系統性探討。
來源
本期分類