跳到主要內容
2026-08-18 日報
研究與評測

Agent Arena 推出新分類榜單:GPT 5.6 Sol 登頂 Code,Claude Opus 5 稱霸 Work 與 Chat

X @arena單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

Agent Arena 正式上線全新分類榜單,針對數百萬個真實世界、長效(long-horizon)代理任務進行模型評測。各分類榜首由不同模型拿下:OpenAI 的 GPT 5.6 Sol (xHigh) 取得 Code(程式碼)分類第一;Anthropic 的 Claude Opus 5 則分別以 (High) 與 (Max) 版本拿下 Work(工作)與 Chat(對話)分類榜首。官方指出,單次長效代理會話的成本可能高達數百甚至一千美元。為此,Agent Arena 在排行榜與帕雷托圖(Pareto graphs)中採用基於任務的成本估算,綜合考量了 Token 定價、快取(caching)以及上下文增長等實際花費因素。
讀原始報導

背景

隨著 AI 代理(Agent)的評估逐漸轉向長期的任務執行,目前多數基準測試仍側重於局部的步驟推理,缺乏對全局最佳化的評估。Agent Arena 則專注於透過數百萬個真實世界的長期代理任務,來衡量各家模型的實際表現。

來源