研究與評測
微軟研究院推出 3,500 行輕量級強化學習框架 Agent Lightning v1.0
Microsoft Research一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
微軟研究院推出輕量級強化學習(RL)框架 Agent Lightning v1.0,其核心程式碼僅 3,500 行。傳統上,由於 AI 代理的工具、上下文與決策皆由複雜的框架管理,使用強化學習來訓練代理極具挑戰性。Agent Lightning 透過提供真實的測試環境(real harnesses),能將現有的 AI 代理直接連接至強化學習訓練中。開發者無須從頭重新建構代理,即可直接進行訓練與效能提升。
讀原始報導背景
代理強化學習(Agentic RL)旨在將大型語言模型(LLM)從被動的文本生成器,轉變為能在複雜環境中自主決策的代理(Agent)。然而,由於現有代理的工具與決策機制通常由複雜的框架管理,將它們與強化學習訓練無縫結合一直是一大挑戰。