研究與評測
三項實測揭露 AI 程式設計 Agent 框架成本差異:Token 消耗最高相差 70 倍
AI 前線綜合 2 家報導多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。
近期三項基準測試顯示,引導模型完成任務的 AI 程式設計 Agent 框架對成本影響巨大。Composio 於 8 月使用 DeepSeek V4 Flash 模型測試 8 種框架完成 30 個企業工作流程,結果顯示每次成功完成任務的成本從 Pi Agent 的 0.028 美元到 Claude Code 的 0.195 美元不等;DeepAgents 的通過率與 Claude Code 相同,但成本僅為其四分之一。
6 月的一項獨立測試透過 OpenRouter 在 DeepSeek V4 Flash 與 Nemotron 3 Ultra 上比較了 12 種配置。結果顯示,每解決一項任務消耗的 Token 數量從 Aider(architect 模式)約 3,500 個到 OpenClaw 的 29.2 萬個不等。差距主要來自框架的「啟動稅」,即每輪對話必須發送的系統提示詞與工具說明。Aider 每輪基礎消耗約 700 個 Token,而 OpenClaw 約 2.6 萬個,導致多輪執行後產生巨大開銷。
快取(Cache)命中率是另一項成本關鍵。Composio 數據顯示,Claude Code 的輸入 Token 僅 1.5% 來自快取,而 Codex 約 70%、OMP 約 57%。6 月測試中,Codex 消耗逾 100 萬個 Token,但 77% 為快取讀取(計費約為未快取費率的十分之一),使其單任務實際成本低於原始 Token 消耗量僅一半的 Claude Code。測試作者推測,Claude Code 快取率低可能肇因於透過 OpenRouter 轉換 Anthropic 風格 messages 端點的服務路徑,閘道器轉換降低了快取命中率。
在任務成功率方面,Composio 報告指出同一模型下各框架通過率從 46.7%(OpenCode)到 66.7%(Pi Agent)不等。此外,6 月測試在任務前注入 10 萬個 Token 的無關日誌雜訊,發現 Kilo 與 Opencode 靜默截斷了 83% 至 89% 的內容卻仍回報成功;OpenClaw 拒絕執行,Kimi Code 崩潰,Claude Code 傳輸完整內容但後續表現不佳。Artificial Analysis 則透過涵蓋 326 項任務的綜合指數持續追蹤,證實了框架選擇對成本與效能的顯著影響。
讀原始報導背景
AI 代理(Agent)框架是引導模型完成任務的軟體,執行時需反覆傳遞系統提示詞與工具說明等上下文。在評估與開發時,開發者常透過 OpenRouter 這類提供統一 API 的平台來存取多種生成式 AI 模型,或結合 Composio 等工具套件讓代理執行實際操作。
來源
- iThome 中國ithome.com
- en.wikipedia.org
- github.com