研究與評測
新研究提出 Recuris 遞迴記憶架構,GPT-5.6 Sol 與 Claude Opus 5 在長視野 Agent 任務提升逾 15 分
HF Daily Papers一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
最新研究提出名為 Recuris 的遞迴經驗與工作記憶(Experiential-Working Memory)架構,旨在解決 Agent 在長視野(long-horizon)任務中因歷史紀錄過長導致狀態模糊與技能調用錯誤的問題。該架構透過工作記憶追蹤任務進度,並從經驗記憶中引導技能選擇,同時利用固定的 Meta-Agent 將執行結果轉化為局部且經過驗證的技能記憶更新,形成遞迴記憶演化迴圈。在 4 個長視野基準測試與 10 款模型的評估中,Recuris 提升了 37 組測試中 35 組的成功率。在 tau-bench 中,使 GPT-5.6 Sol 提升 17.8 分,Claude Opus 5 提升 15.6 分(總成功率達 87.9%);在 SkillFlow 測試中,Qwen3.6-27B 與 35B 分別提升 16.6 與 13.5 分。數據顯示,互動視野越長優勢越明顯,在最長任務中表現提升達 32.2 分,常見的長視野失敗率最高降低 80%。相關程式碼已於 GitHub 開源。
讀原始報導背景
遞迴自我改善(RSI)是一種假設性的過程,指人工智慧系統透過改寫自身程式碼來提升能力,理論上可能帶來超級智慧。在評估這類代理程式處理複雜任務的能力時,常會使用如 tau-bench 等基準測試,該測試主要模擬使用者與具備 API 工具的代理程式之間的動態對話。