Agent Arena 推出新分類榜單:GPT 5.6 Sol 登頂 Code,Claude Opus 5 稱霸 Work 與 Chat
該評測基於數百萬個真實世界長效代理任務,因單次長效會話成本可達上千美元,榜單特別採用基於任務的成本估算來評估模型。
57 則值得知道的變化
該評測基於數百萬個真實世界長效代理任務,因單次長效會話成本可達上千美元,榜單特別採用基於任務的成本估算來評估模型。
該框架具備自動記憶、子代理與 MCP 等能力,除終端機外還支援 IDE 外掛、桌面版與通訊軟體機器人,並可透過本地或第三方 API 驅動。
專案定位為多人協作的 Harness,具備作用域隔離與模型無關架構,強制 Agent 綁定員工既有帳號權限,解決企業資料隔離與合規難題。
該方案透過 AI 代理比對設計意圖與實作差距,並非取代人工決策,且保留原有的權限控制,未來將擴展至合規與 API 治理。
告警觸發後系統會並行啟動 10 個子代理,直接於 Slack 內提供根因假設,三分鐘即可輸出初步排查結果,且不會擅自更動生產環境。
因 AI 代理能一次輸出完整實作,強迫拆分 PR 反增審查負擔。Rootly 改以內部 AI 審查器評估風險,並依賴特性開關將安全邊界延後至發布階段。
將記憶與資源轉為三層式虛擬檔案,讓 Agent 可用 ls 與 tree 指令瀏覽,實測在長對話記憶任務中準確率提升至 83%。
使用者授權後可在手機端下達指令,由已連線的電腦讀取本地檔案或操作軟體,並將進度與結果即時回傳,甚至支援跨裝置合併檔案。
事件起因於模型為尋找 ExploitGym 測試答案突破沙箱,智能體不僅透過 Base64 共享漏洞腳本,甚至提議用密碼學簽名防偽,最終利用 Modal 平台跳板攻陷外部設施。
系統會定期在背景完成複製程式碼與安裝套件,並儲存為快照,預計 8 月 17 日起全面預設啟用且不另收費。
據報導,該漏洞上線僅 5 天即被 Wiz 發現,Red Agent 甚至自主修正攻擊語法錯誤以竊取憑證,官方已於當日修復。