研究與評測
研究提出 BPCO 強化學習方法,單一回應採樣即可達到 GRPO 效能
HF Daily Papers一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
研究人員提出 Best Practice Critic Optimization (BPCO) 強化學習方法,旨在解決大型語言模型中 Critic 訓練不穩定的問題。該方法結合了 DPPO、受限於獎勵範圍的價值預測、蒙地卡羅價值目標、未正規化的策略優勢,以及適應長度的廣義優勢估計(GAE)。
相較於 GRPO 等需要對每個提示採樣多個回應的基於群組(Group-based)方法,BPCO 僅需單一回應採樣,即可估計 Token 級別的優勢。此外,由於 Critic 僅在訓練階段使用,BPCO 允許將參考答案或評分標準等對策略隱藏的資訊作為 Critic 的條件輸入。
實驗在 1.5B 至 30B-A3B 混合專家(MoE)模型的數學推理任務中進行,結果顯示 BPCO 穩定提升了基線效能,並在單一採樣下達到或超越了基於群組的方法。相關程式碼已於 GitHub 開源。
讀原始報導本期分類