研究與評測
Opus 5登Agent Arena亞軍
X @arena綜合 3 家報導
Arena.ai公布,逾7,000次實際代理工作階段顯示,Claude Opus 5 Max以11.88%淨改善率居Agent Arena第2,僅次Fable 5;High版以11.73%居第3,兩者均勝GPT-5.6 Sol (xHigh)。Max在Confirmed Success與Praise vs Complaint訊號均居首,但成績仍屬初步;High分列第4與第3。以整體任務成本計,High、Max雖勝GPT-5.6 Sol (xHigh)但較昂貴;Medium表現與成本均約相當,Fable 5 (High)價格效能最佳。
讀原始報導背景
Agent Arena 是以真實使用情境評估自主 AI 代理的排行榜,這些代理可瀏覽網路、研究、撰寫程式並完成實際任務。其排名不採成對投票,而是透過「causal tracing」將代理視為多元件系統,並彙整確認成功、稱讚與抱怨、可操控性及工具幻覺等訊號,估算模型對任務成功率的「net improvement」。
這則事件的發展
來源
- X @arenanitter.net
- X @arenanitter.net
- arena.ai
- aissential.tech
- arena.ai