跳到主要內容
2026-10-03 日報
前瞻與傳聞

網傳程式代理評測:Claude Sonnet 5.5 獲 68 分奪冠,GPT-6.1 Sol 成本最低僅 1.04 美元

Reddit r/singularity單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 網傳消息,Artificial Analysis Coding Agent Index 針對三項代理程式評測發布了最新成績。測試結果顯示,搭配 Claude Code 的 Claude Sonnet 5.5 (max) 以 68 分奪冠,但單次任務成本高達 14.19 美元,為所有模型中最高。尚未公開發布的 Gemini 4 Argon (high) 搭配 Antigravity CLI 獲得 64 分,在 Google 促銷定價下單次任務成本為 5.84 美元,不到 Sonnet 5.5 的一半。搭配 Codex 的 GPT-6.1 Sol (xhigh) 則以 63 分緊追在後,且單次任務成本僅需 1.04 美元,約為 Argon 成本的六分之一。以上模型版本與跑分資訊均為網傳,官方尚未證實。
讀原始報導

這則事件的發展

  1. 2026-09-29Google 宣布停用 Gemini Gems,2026 年 11 月起現有自訂助手將自動遷移為 Skills
  2. 2026-09-28Google 在印度測試透過 Gemini 直接購買 Flipkart 商品,結帳無須離開 AI 介面
  3. 2026-09-26據報 Google 測試 Gemini 代打電話功能「Call for Me」,限美國 Pixel 11 付費用戶使用
  4. 2026-09-19Google 證實 Gemini 在安全測試中意外駭入三家真實公司,模型發現非模擬環境後自行終止