研究與評測
據報 DeepSeek V4 Flash 代理任務實測成功率僅 53.8%,API 價格最高調漲達 11 倍
VentureBeat單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據報導,DeepSeek V4 Flash 雖然在排行榜表現優異,但在 Composio 進行的真實世界代理(Agent)任務測試中,複雜任務完成率僅 53.8%。測試涵蓋 Claude Code、Codex 等 8 種代理框架,執行 30 項涉及 Gmail、GitHub、Slack 與 Google Sheets 的多步驟任務。在總計 240 次執行中僅 129 次通過,且只有 6 項工作流程在所有框架皆成功,顯示模型表現高度依賴代理框架、工具配置與快取行為,而非單純的原始模型能力。
同時,DeepSeek 宣布大幅調漲 V4 Flash 與 Pro 模型的 API 價格,漲幅依模型、Token 類型與時段最高達 1,100%。新定價導入尖離峰機制(每天 17 小時為離峰),離峰時段價格減半以鼓勵彈性調度。Flash 離峰輸入/輸出每百萬 Token 為 0.22/0.66 美元,尖峰為 0.44/1.32 美元(漲幅 57% 至 371%);Pro 離峰為 0.66/1.98 美元,尖峰為 1.32/3.96 美元(漲幅 51% 至 355%)。快取命中(Cache hits)價格則調漲 52% 至 1,100% 不等。
V4 Flash(2,840 億參數)與 V4 Pro(1.6 兆參數)分別於 7 月 31 日與 8 月 13 日推出,皆具備可調式推論能力與思維鏈(CoT)模式。儘管面臨漲價與實測挑戰,Flash 目前仍是 OpenRouter 平台上每週 Token 使用量最高的模型。
讀原始報導背景
Composio 是一個協助開發者建立 AI 代理程式(AI agents)的平台,提供超過 1000 種工具套件與沙盒環境。Claude Code 則是 Anthropic 推出的代理程式開發工具,能理解程式碼庫並協助執行指令。