模型發布
Anthropic推出Opus 5
科技新報 AI綜合 2 家報導據報導
據報導,Anthropic 於當地時間7月24日推出適用於日常複雜知識工作與軟體工程的 Claude Opus 5,稱其效能接近 Fable 5、價格僅一半,並以與 Opus 4.8 相同的成本大幅提升效能;產品負責人 Dianne Penn 表示,新版比5月推出的 Opus 4.8 更高效,且 Opus 5 已成為 Claude 平台預設模型及 Claude Pro 主打的高性價比選擇。每百萬代幣價格方面,Opus 5 輸入/輸出為5/25美元,Fable 5 為10/50美元,GPT-5.6 Sol 為5/30美元;但按智力指數任務加權平均計算,同一任務成本依序為 Fable 5 的2.75美元、Opus 5 的2.03美元、GPT-5.6 Sol 的1.04美元及 Kimi K3 的0.95美元。評測結果顯示,Opus 5 在 Frontier-Bench v0.1 的效能超過 Opus 4.8 兩倍且單次任務成本更低,在 ARC-AGI 3 得分為次佳模型三倍、Zapier AutomationBench 通過率為同成本次佳模型1.5倍,並在 OSWorld 2.0 以相同成本超越所有模型及 Fable 5 最佳成績;受限觀看圖紙重建3D零件時,它還自行編寫電腦視覺管線,完成其他模型嘗試五次仍未做到的任務。工程師 Thariq Shihipar 指出,官方刪除了80%的 Claude Code 系統提示詞,建議以 claude doctor 優化提示詞,並提醒 Opus 5 預設回應較冗長,應明確限制長度以免輸出代幣拉高成本;資安測試中,其 OSS-Fuzz 漏洞發現率為80%,接近 Mythos 5 的79.4%,但漏洞武器化成功率僅4/14,低於 Mythos 5 的13/14,且會阻擋二進位漏洞掃描與滲透測試生成。Opus 5 據稱已在全球所有平台上線,支援預設速度2.5倍的快速模式;API 新增 Auto-fallback,敏感請求觸發 Opus 5 或 Fable 5 安全分類器時會自動降級以維持工作流,開發者也能在對話途中更改 Tool use 而不使提示快取失效,一般 API 存取則維持不保留用戶資料的承諾。
讀原始報導背景
ARC-AGI-3 是互動式推理評測,要求 AI 代理探索陌生環境、即時理解目標、建立可調整的世界模型並持續學習,用以衡量面對全新問題時的流動推理能力。OSWorld 2.0 則包含 108 項日常與專業情境的長流程電腦操作任務,每項任務由人類完成的時間中位數約為 1.6 小時,可用來評估 AI 代理執行真實端到端工作流程的能力。