前瞻與傳聞
網傳程式代理評測:Claude Sonnet 5.5 獲 68 分奪冠,GPT-6.1 Sol 成本最低僅 1.04 美元
Reddit r/singularity單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 網傳消息,Artificial Analysis Coding Agent Index 針對三項代理程式評測發布了最新成績。測試結果顯示,搭配 Claude Code 的 Claude Sonnet 5.5 (max) 以 68 分奪冠,但單次任務成本高達 14.19 美元,為所有模型中最高。尚未公開發布的 Gemini 4 Argon (high) 搭配 Antigravity CLI 獲得 64 分,在 Google 促銷定價下單次任務成本為 5.84 美元,不到 Sonnet 5.5 的一半。搭配 Codex 的 GPT-6.1 Sol (xhigh) 則以 63 分緊追在後,且單次任務成本僅需 1.04 美元,約為 Argon 成本的六分之一。以上模型版本與跑分資訊均為網傳,官方尚未證實。
讀原始報導