模型發布
DeepSeek V4 Flash 正式版在 OpenCode 單日耗用 8 兆 Token,每百萬輸出收費 2 元人民幣
愛範兒綜合 2 家報導多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。

OpenCode 表示,DeepSeek V4 Flash 正式版透過其平台單日耗用 8 兆 Token,其中 5 兆來自免費額度、3 兆來自付費方案 OpenCode Go。相較之下,接入逾 400 款模型的 OpenRouter 每月處理約 200 兆 Token,每日平均約 6.6 兆。
DeepSeek 於 7 月底推出 V4 Flash 正式版,每百萬輸出 Token 收費 2 元人民幣;Claude Opus 4.8 的標準價格為 25 美元、約 170 元人民幣,兩者輸出單價相差約 85 倍。Agent 的反覆工具呼叫也會放大用量:有人以 Claude Opus 5 製作單頁 3D 遊戲,最終產出一個 HTML 檔案,但整個過程耗用 6.9 億 Token,費用接近 3,000 元人民幣。
截至 8 月 2 日的 Arena 頁面快照,V4 Flash 在前端程式設計評測的初步排名暫居 Opus 4.8 Thinking 之前。Artificial Analysis 的 Intelligence Index v4.1 則顯示,V4 Flash Max 得 50 分、Claude Opus 4.8 Max 得 56 分;完成整套評測的模型呼叫費分別約為 72.02 美元與 3,752.55 美元,Opus 多得 6 分,但成本約高 52 倍。
DeepSeek 7 月 31 日的更新紀錄指出,正式版 V4 Flash 與 Preview 的架構和規模相同,僅重新進行後訓練,重點強化程式設計與 Agent 任務。正式版在 Terminal Bench 2.1 得到 82.7 分,但該成績使用尚未發布的 DeepSeek Harness 極簡模式與 max 推理檔位;模型也新增原生 Responses API,並針對 Codex 進行適配。
V4 Flash 總參數量為 2,840 億,每個 Token 約啟用 130 億參數,並採用混合注意力、低精度權重及長上下文快取最佳化。DeepSeek 4 月發布的 Preview 技術報告估算,在 100 萬 Token 上下文中,V4 Flash 的單 Token 推論計算量約為 DeepSeek V3.2 的 10%,KV Cache 約為後者的 7%。其 Transformer 交錯採用先壓縮再尋找重點的 CSA,以及高度壓縮但完整瀏覽的 HCA;前饋層則沿用 DeepSeekMoE,僅將每個 Token 路由至少數專家。
Preview 的後訓練流程分別訓練數學、程式碼、Agent 與指令遵循專家,透過 SFT、GRPO 及十多個教師模型的 On-Policy Distillation 合併能力。DeepSeek 另設計專用工具呼叫格式、可在工具回傳後延續推理的 Interleaved Thinking,以及提供數十萬個並行沙箱的 DSec,讓模型練習執行程式碼、讀取錯誤並持續修改。
官方儲存庫中的 V4 Flash 權重檔案合計約 167 GB,DeepSeek 提供的 vLLM 服務範例使用一台配備 4 張 GB300 的伺服器。社群專案 DwarfStar 透過低位元量化,讓 q2 版本可在具備 96GB 或 128GB 統一記憶體的裝置執行,q4 版本則建議至少配置 256GB 記憶體;部分 128GB Mac 在短上下文測試中可達每秒 20 多個 Token。極低位元量化可能損害程式碼、長上下文與工具呼叫能力,因此 q2 版本不代表能重現官方 API 的 Agent 成績。
以每百萬輸出 Token 0.28 美元計算,一台售價約 4,699 美元的 DGX Spark,相當於約 168 億個輸出 Token,且尚未計入本地部署所需的電費、維護及除錯成本。
讀原始報導來源
- 科技新報 AIfinance.technews.tw