跳到主要內容
2026-08-17 日報
研究與評測

新研究聲稱推理 RL 僅改變 1-3% token,並推出 Guru 資料集以少 1000 倍算力無 RL 達成相同增益

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據社群討論與最新論文聲稱,使用強化學習(RL)來提升模型的推理能力,實際上僅改變了約 1-3% 的 token。該研究團隊表示,他們成功在不使用 RL 的情況下複製出相同的推理增益,且消耗的算力減少了約 1000 倍。為此,該研究推出了名為 Guru 的強化學習推理資料集,共包含 9.2 萬筆可驗證範例,涵蓋數學、程式碼與科學等六大領域。
讀原始報導

背景

近期有研究重新探討強化學習(RL)在大型語言模型(LLM)推理能力上的作用。該研究團隊推出了名為 Guru 的資料集,包含 9.2 萬筆涵蓋數學、程式碼與科學等六大領域的可驗證推理範例。

來源

本期分類
相關主題