開發生態
Codex CLI 缺乏 AWS Bedrock GPT-5.6 Sol 快取控制,導致快取寫入成本高達 85%
Hacker News單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
開發者在 GitHub 回報,Codex CLI(版本 0.147.0)在使用原生 Amazon Bedrock 供應商時,無法啟用 GPT-5.6 Sol 的明確提示詞快取(explicit prompt caching)功能。在代理程式(agentic)程式碼編寫工作負載中,這項缺陷導致系統產生大量快取寫入 token,進而引發高昂費用。
根據回報的生產環境數據,在四天內(2026 年 8 月 5 日至 8 日)共發出 3,656 次請求,產生 171.94M 個快取寫入 token;估計快取寫入成本為 1,182.09 美元,佔總估計成本(1,386.46 美元)約 85%。另一項本機測試顯示,76 次 GPT-5.6 Sol 請求產生了 6.709M 個快取寫入 token,但快取讀取 token 為零,平均每次請求寫入約 88K 個 token。
問題根源在於 Codex 雖發出 session 範圍的 prompt_cache_key,但 HTTP 與 WebSocket 請求中缺少 prompt_cache_options 與 prompt_cache_breakpoint 參數,且無法透過 config.toml 設定。開發者建議官方新增對 GPT-5.6 回應供應商的快取選項序列化支援,並在每次對話的使用量遙測中顯示快取讀寫數據,以便用戶診斷成本高昂的全前綴重寫問題。
讀原始報導背景
Amazon Bedrock 是由 AWS 提供的雲端運算服務,讓開發者能透過統一的 API 存取多家 AI 公司的基礎模型。GPT-5.6 Sol 則是 OpenAI 於 2026 年 7 月推出的 GPT-5.6 系列中,能力最強的大型語言模型版本。
社群討論
社群證實 Codex on AWS Bedrock 因快取讀寫比例低於 5% 導致 10 倍帳單暴增,有用戶的 200 美元月費僅兩天就耗盡,目前解法是設定 web_search = "disabled"。開發者推測 v5.6 版可能更改了底層架構(如放棄傳統 cached KV sequence),導致修改提示詞會污染快取並引發高昂寫入成本,引發對官方未公告變更及 AWS 缺乏計費上限的強烈不滿。部分用戶質疑官方刻意忽視此問題以增加營收,並建議改用本地端方案,例如以 unsloth 搭配 qwen 3.8 模型,在 5090 顯卡上可達 100+ tok/sec 的高效能。