研究與評測
36.5萬項代理任務公開
X @PrimeIntellect
Prime Intellect 公開超過 365,000 項任務,涵蓋 SWE、終端機與搜尋代理,共包含 23 組任務集。這些任務整合於單一 API、統一沙盒生命週期與單一指令之下,可支援 agentic RL 的訓練與評測。
讀原始報導背景
強化學習適合無法預先確定正確行動順序的情境,代理必須透過反覆嘗試及正負回饋,學習如何提高長期成功率。Agentic RL 的環境通常涵蓋資料集、代理執行框架、驗證器與狀態;以程式代理為例,可能需要多次呼叫工具並執行測試,才能確認任務是否完成。
來源
相關主題