Agent Arena 推出新分類榜單:GPT 5.6 Sol 登頂 Code,Claude Opus 5 稱霸 Work 與 Chat
該評測基於數百萬個真實世界長效代理任務,因單次長效會話成本可達上千美元,榜單特別採用基於任務的成本估算來評估模型。
X @arena單一來源
57 則值得知道的變化
該評測基於數百萬個真實世界長效代理任務,因單次長效會話成本可達上千美元,榜單特別採用基於任務的成本估算來評估模型。
該模型基於自研 UiT 架構,支援文本與圖像等多模態輸入,透過 Memory 上下文與 TTT 機制解決時空一致性難題,論文已入選 ECCV 2026。
支援逾 40 種語言,定價每百萬字元 49 美元,雖高於 Simba 3.2 等同級競品,但價格僅 Eleven v3 的一半。