跳到主要內容
2026-08-20 日報
研究與評測

Agent Arena 推出 Pareto frontier 代理任務評測:Claude Opus 5 效能居冠,Kimi K3 具成本優勢

X @arena綜合 2 家報導單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

Agent Arena 推出 Pareto frontier(帕雷托前緣)功能,對比各模型在真實世界代理任務(agentic tasks)的效能表現與每次任務的中位數成本。 目前位於 Pareto frontier 的模型中,Anthropic 的 Claude Opus 5 (High) 以 +12.34% 的效能提升居冠,單次任務成本為 1.78 美元。數據顯示,Claude Opus 5 (Max) 的成本高達 3.37 美元,幾乎是 Opus 5 (High) 的兩倍,但效能(+12.0%)反而略低。 Kimi K3 (Max) 展現極高性價比,整體效能排名第 4(+10.53%),其 0.62 美元的成本為前八名模型中最低。前五名模型的成本差異超過 5 倍。 OpenAI 排名最高的模型為 GPT-5.6 Sol (xHigh),位居第 5(+9.8% / 1.39 美元),成本低於排在其前面的三款 Anthropic 模型;GPT 5.5 (High) 則為 +7.75% / 0.44 美元。 在低成本區間,Grok 4.5(+6.08% / 0.22 美元)與 Qwen 提供了具競爭力的表現;極低成本端則有 GPT 5.6 Luna (xHigh)(+4.25% / 0.04 美元)與 Mimo V2.5 Pro(-2.22% / 0.03 美元)。
讀原始報導

背景

在多目標最佳化問題中,Pareto frontier 代表一組最佳解的集合。在這些解當中,由於不同目標之間存在權衡關係,沒有任何單一選項能完全勝過其他選項。在此排行榜中,它被用來呈現各家 AI 模型在「任務效能」與「執行成本」之間的最佳平衡點。

這則事件的發展

  1. 2026-08-18Agent Arena 推出新分類榜單:GPT 5.6 Sol 登頂 Code,Claude Opus 5 稱霸 Work 與 Chat

來源