跳到主要內容
2026-08-29 日報
研究與評測

研究指演化策略(ES)在 LLM 推理後訓練具更廣覆蓋率,能解決 GRPO 熵崩潰並提升 Pass@K

HF Daily Papers一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

近期研究系統性探討演化策略(Evolution Strategies, ES)在 LLM 推理後訓練的機制,證實其能提供比 GRPO 更廣泛的推理覆蓋率。實證顯示,GRPO 在訓練中會出現熵崩潰(entropy collapse),而 ES 則能維持群體間的 Jensen-Shannon 多樣性,不僅提升 Pass@1,更能達到比 GRPO 更高的 Pass@K 表現。研究團隊為此開發了序列式的 GRPO-ES 訓練策略,結合 GRPO 在 Pass@1 的優勢與 ES 在 Pass@K 的增益。 此外,研究發現儘管 ES 會造成全模型參數大幅漂移,但任務效能增益僅來自少數較大幅度的更新。這種功能稀疏性意味著參數大變動不代表廣泛的功能改變,保留測試(held-out evaluations)也顯示其不一定會引發災難性遺忘。在超參數設計上,實驗表明較大的 LLM 在使用 ES 時需要較小的群體大小(population size)。此研究將 ES 定位為獨立的推理後訓練範式,而非僅是 GRPO 的省記憶體替代方案。
讀原始報導

背景

Group Relative Policy Optimization (GRPO) 是一種主流的模型後訓練(post-training)範式,屬於直接學習策略函數而非價值函數的增強學習演算法。近期,演化策略(Evolution Strategies, ES)作為一種節省記憶體的替代方案逐漸受到關注,但其最佳化行為與優勢範圍過去較少被系統性探討。

來源

本期分類