模型發布
Anthropic 發布 Claude Sonnet 5.5:速度提升 30%、單任務成本降 30%,代理程式編寫跑分超越 Opus 5.5
Hacker News綜合 7 家報導一手來源
核實資料不足
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
本次未取得足夠原文證據

Anthropic 距前代發布約三個月後,推出 Claude 5.5 家族第二款模型 Claude Sonnet 5.5。該模型定位為 Opus 5.5 的低成本、高速度互補品,專注於日常任務、修復 Bug、文件製作與設計。
官方表示,Sonnet 5.5 生成速度較前代提升 30% 以上。其定價維持與 Sonnet 5 相同(輸入每百萬 Token 2 美元、輸出 10 美元、快取讀取 0.20 美元),但因完成同等任務所需的 Token 數量大幅減少,且能更有效率地批次呼叫工具,實際單任務成本降低達 30%。
在效能評測上,Sonnet 5.5 於代理程式編寫基準 Terminal-Bench 4.0 取得 70.6% 的成績,不僅遠勝前代的 10.3%,更超越高階模型 Opus 5.5 的 66.4%(有報導指出,這可能是因為其成本較低,能同時啟動多個代理而未達成本上限)。在涵蓋 44 種職業的真實世界知識工作測試 GDPval-AA 中,得分 1844,僅落後 Opus 5.5 兩分。此外,它也是首款僅靠螢幕截圖就能通關《寶可夢 紅》的 Sonnet 模型。
該模型目前已全面上線,除了登陸 AWS、Google Cloud 與 Azure 三大雲端平台,也已取代先前的模型,成為 claude.ai 免費版所使用的驅動模型。Anthropic 預告,主打高吞吐量的 Claude Haiku 5.5 將於未來幾週內推出。
安全性方面,因其網路攻防能力已達 Opus 5 水準,Sonnet 5.5 成為首款具備與最高階模型同等網路安全防護與防模型蒸餾(distillation attacks)機制的 Sonnet 模型。不過,開發者 Simon Willison 實測發現,Sonnet 5.5 存在與 Opus 5.5 相同的 Bug:在設定為「Max」思考強度生成 SVG 圖像時,會耗盡 128,000 個 Token(成本約 1.28 美元)卻無法產出結果,需降級至「xhigh」強度才能正常運作。
讀原始報導背景
GDPval 是一個評估 AI 模型在真實世界具經濟價值任務表現的基準測試,涵蓋了 44 種職業。Claude Sonnet 5.5 透過此類測試,展現其在實際工作場景與多樣化任務中的應用能力。
社群討論
社群對 Sonnet 5.5 評價兩極,雖在 Terminal-Bench 以 70.6 分超越 Opus 5.5 的 66.4 分(有留言指出是因 Opus 觸發較多安全降級),且比前代快又便宜 30%,但多數人質疑其定價與定位。最大的批評在於高推論強度下的成本效益不佳,實測顯示它曾耗費 15 分鐘燒光 12.8 萬個 thinking tokens 卻未完成任務,多數用戶建議高強度任務直接使用 Opus 5.5。此外,不少留言指出在低成本端,DeepSeek、Luna 與 Gemini Flash 3.8 等模型更具價格優勢。
來源
- Simon Willisonsimonwillison.net
- TechCrunch AItechcrunch.com
- The Decoderthe-decoder.com
- iThome 中國ithome.com
- Reddit r/ClaudeAIreddit.com
- Reddit r/singularityreddit.com
- Techmemetechmeme.com
- arxiv.org