跳到主要內容
2026-08-15 日報
研究與評測

DeepSeek V4 Flash 搭配 Pi Agent 於 Composio 測試擊敗 Claude Code,單次任務成本僅 0.028 美元且快取命中率達 99.9%

InfoQ 中國多家報導
尚未逐項核實

多個報導來源提及此事;未必是彼此獨立的證據。

Composio 針對 DeepSeek V4 Flash 進行 8 款 Agent Harness 的 30 項複雜任務橫向評測。Pi Agent 以全新預設安裝、僅接入 MCP 伺服器外掛的極簡配置,通過 20 項任務(成功率 66.7%)奪冠。Oh My Pi 通過 17 項居次,Claude Code、Codex 與 Deep Agents 皆通過 16 項。配置最複雜的 Prime Agent 因部分會話消耗達 350 萬 Token 且進行 33 次工具呼叫,導致評分器超時,僅通過 15 項。 在成本與速度方面,Pi 平均完成單項成功任務僅需 0.028 美元,約為 Claude Code(0.195 美元)的七分之一;Pi 的任務中位數耗時為 132.2 秒,略慢於 Claude Code 的 122.7 秒與 OpenCode 的 129.7 秒。 開發者實測顯示,Pi 呼叫 DeepSeek V4 Flash 處理近 10 億輸入 Token 時,快取命中率達 99.93%,成本從無快取的 132 美元降至 2.65 美元。相較於其他 Harness 通常 94% 至 97% 的命中率,Pi 允許動態增刪工具與自訂上下文壓縮,利於 DeepSeek 的前綴快取(Prefix Cache)最佳化。 社群已衍生多款專屬快取最佳化專案。開源終端 Agent「Reasonix」透過啟動時注入穩定環境摘要、截斷過時工具輸出,並將執行與規劃模型拆分至獨立會話,以維持提示詞前綴穩定。第三方擴充套件「pi-deepseek-cache」則在 P0 層凍結日期與工作目錄,P3 層使用 temperature 為 0 的 DeepSeek V4 Flash 進行確定性摘要並進行雜湊(Hash)快取,P2 層透過 SHA-256 診斷前綴變化。該套件使 V4 Flash 輸入成本降幅達 98%(每百萬 Token 0.14 美元降至 0.003 美元),V4 Pro 降幅達 99%(3.00 美元降至 0.025 美元)。 此外,據報導「DeepSeek Harness 團隊」微信公眾號已於 8 月 11 日註冊並啟動產品內測,外界預期官方 Harness 即將發布。
讀原始報導

背景

Agent harness 是圍繞大型語言模型的軟體基礎設施,負責管理工具使用、記憶體與執行環境,使模型能作為 AI 代理運作。新聞中提及的 MCP(Model Context Protocol)則是由 Anthropic 於 2024 年 11 月推出的開源標準,旨在讓 AI 系統能標準化地與外部工具及資料來源整合。

這則事件的發展

  1. 2026-08-08傳 DeepSeek 重啟融資目標三年市值對齊騰訊,崔添翼指流出簡報未必造假
  2. 2026-08-06傳 DeepSeek 重啟第二輪融資:計畫募資 500 億人民幣,投前估值達 5,000 億

來源