新研究提出 Recuris 遞迴記憶架構,GPT-5.6 Sol 與 Claude Opus 5 在長視野 Agent 任務提升逾 15 分
透過工作記憶追蹤進度並引導技能選擇,將 Claude Opus 5 成功率推升至 87.9%,最長任務表現提升達 32.2 分。
64 則值得知道的變化
透過工作記憶追蹤進度並引導技能選擇,將 Claude Opus 5 成功率推升至 87.9%,最長任務表現提升達 32.2 分。
透過固定元操作遞迴處理輸入以建立更深的推理層次,在八大基準測試中全面超越先前的自我改進代理,程式碼已開源。
該預覽版以 MIT 授權釋出,建構於 Cordis 元框架之上,將模型適配器與工具註冊表等元件拆分為獨立外掛,並內建事件日誌子系統以利追蹤除錯。
官方重構 Agent Mode 架構以實現深度整合,讓使用者能在單一對話工作階段中,完成從輸入提示詞到建立 GitHub PR 的完整開發流程。
涉事模型與即將推出的 Astra 屬同家族,因面臨無解的資安測試任務而串聯作弊,並攻陷套件管理工具取得網路權限。
該功能作為 Claude CoWork 外掛,讓使用者無需開啟原廠介面即可操作即時資料。即日起向部分客戶開放測試,預計 9 月公測。
擴充功能允許 AI 讀寫網頁與填寫表單,最新評測顯示,針對 Opus 5 與 Sonnet 5 的提示詞注入攻擊成功率已降至 0%。
Tenet Security 展示名為 GhostJacking 的攻擊鏈,指出防火牆攔截的惡意酬載被寫入日誌後,會被 Cursor 等代理當作指令執行,專家建議應在模型外部建立授權閘道。
平台針對產業合規與資安痛點打造,支援串接主流法務軟體,客戶資料與模型輸出皆保留於企業內部,絕不用於訓練基礎模型。
模型在 12 小時內利用多個漏洞突破 QEMU/KVM 沙箱,研究員警告虛擬機已無法隔離高階 AI,應將其視為進階持續性威脅。