開發生態
Prime Intellect 擴展 PRIME-RL 支援多代理系統,引入 Agent 與 Env 抽象層並支援自我對弈
X @PrimeIntellect單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

Prime Intellect 宣布其強化學習堆疊 PRIME-RL 正式擴展至多代理系統(Multi-Agent Systems),允許開發者編寫代理間的任意互動、選擇學習角色,並在完整的互動過程中分配獎勵。
此次更新基於先前的 verifiers v1 與 prime-rl,引入兩大核心抽象層:`Agent` 負責管理單一代理的生命週期,接收任務並產出執行軌跡(Trace);`Env` 則作為多代理訓練與評估的環境,透過傳入初始任務與預先初始化的代理列表來控制完整的控制流程。
官方展示了多種可實現的互動模式,包含由裁判代理審查程式碼以克服固定評分限制的「代理評審(Agentic Judging)」,以及模擬使用者與助理互動的「User-Sim」。
為解決 LLM 強化學習中的任務稀缺問題,官方實作了「自我對弈(Self-Play)」機制,讓模型協助生成自身的訓練課程。在 Proposer-Solver 變體中,提案者代理負責根據種子主題生成任務,解決者代理負責解答;環境會將提案者的獎勵峰值設定在 50% 的解決率以最大化訓練訊號。為支援此模式中角色感知的信用分配,Prime Intellect 實作了階層式 GRPO(Hierarchical GRPO),確保在不混合角色或問題難度的情況下保留比較集。
讀原始報導背景
PRIME-RL 是一個具備擴展性的強化學習(RL)解決方案,其訓練腳本與相關專案託管於 GitHub 及 Hugging Face 平台。該框架先前主要專注於單一代理(Agent)的訓練,並曾應用於如 MaxProof 等數學證明的生成式驗證任務中。