研究與評測
DeepSeek V4 Flash 官方 API 憑 0.0028 美元快取價與極高命中率,長會話實際成本遠低於第三方
InfoQ 中國多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。
近期開發者實測發現,儘管第三方平台提供的 DeepSeek V4 Flash API 標價較低,但在長會話任務中,官方 API 憑藉極高的快取命中率與每百萬 Token 0.0028 美元的快取價,實際成本遠低於第三方。
根據 OpenRouter 數據,DeepInfra 的 V4 Flash 輸入與輸出價格為每百萬 Token 0.09 及 0.18 美元,比官方的 0.14 及 0.28 美元便宜約 36%。由於 DeepSeek 開放權重,第三方廠商可直接下載部署(如 DeepInfra 標註為 FP4 精度),而官方未完全公開 API 精度。
然而,開發者以包含 100 多個程式碼儲存庫的專案進行實測,發現使用第三方訂閱服務 OpenCode Go(月費 10 美元)呼叫 DeepSeek 的消費金額平均為官方 API 的 4 倍,部分長會話差距超過 10 倍。成本差異主要來自快取命中率(Cache Hit)。第三方實測 2 萬次請求顯示,DeepSeek 官方快取命中率高達 100%,且間隔 12 小時仍未失效;相比之下,MiniMax 非工作時間命中率約 90%,GLM 在 5 分鐘後僅剩 25%。
DeepSeek 的快取優勢得益於 V4 架構的 Token-wise Compression 與 DeepSeek Sparse Attention (DSA),將百萬 Token 的 BF16 KV Cache 從 V3.2 的 83.9 GiB 壓縮約 8.7 倍至 9.62 GiB,並透過公共前綴檢測等三種機制主動將快取前綴寫入磁碟。
此外,第三方路由與官方 API 在品質上存在差異。經 OpenCode 路由的 V4 Flash 上下文會被截斷至約 600k,而官方為全量 1M。模型在不同工具(Harness)中的表現也不同:V4 Flash 在 Codex 中的表現可與 Fable 5 打平,長程任務的記憶連貫性明顯優於 OpenCode。DeepSeek 官方已釋出 Codex 專屬配置,支援平行工具呼叫與約 104 萬 Token 上下文,並定義了長任務的上下文壓縮行為。
讀原始報導背景
OpenRouter 是一個提供統一應用程式介面(API)的美國人工智慧平台,讓開發者能存取來自多個推論供應商的大型語言模型。由於 DeepSeek 模型開放權重,第三方廠商可直接在自家的加速器叢集上運行,從而在 OpenRouter 等平台上出現與官方不同的定價與推論策略。
來源
- AI 前線infoq.cn
- en.wikipedia.org