研究與評測
PaperGym 將論文轉為強化學習環境,訓練 Qwen3-8B 研究規劃能力超越 Kimi K2.6
HF Daily Papers一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
PaperGym 是一個將科學論文轉化為強化學習訓練環境的統一框架,旨在提升 AI 模型的研究規劃能力。現有流程常從相同內容擷取問題與準則,導致模型可透過改寫來獲取獎勵;PaperGym 則利用論文結構,從研究目標與背景合成問題,並從方法與實驗推導出涵蓋方法創新與實驗設計的評估準則。
此作法將準則外洩率(criterion leakage)降至 3.7%,遠低於現有資料集的 11.90% 至 34.10%。訓練過程兩次使用評估準則:首先作為 OPSD 自我教導的特權上下文(privileged context),接著作為 GRPO 的獎勵。
在 Qwen3-1.7B、4B 與 8B 模型上,此訓練排程超越了監督式微調(SFT)及單一階段訓練,在五項評測基準平均分別提升 5.6、5.0 與 4.8 分。使用 PaperGym-20k 訓練的模型在三方比較中勝率達 58.1%(對比 RubricHub Science 的 28.2%)。經訓練的 Qwen3-8B 在 ResearchQA 取得 73.48 分,超越體量更大的 Kimi K2.6。
研究團隊已釋出處理流程、包含兩萬筆實例的 PaperGym-20k 語料庫,以及 PaperGym-Innov 與 PaperGym-Design 評測基準。
讀原始報導