跳到主要內容
2026-10-01 日報
前瞻與傳聞

傳 OpenAI 與 Anthropic 採用 DeepSeek 快取架構,GPT-6.1 Sol 與 Claude Opus 5.5 讀取成本大降 60% 至 80%

Hacker News單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,OpenAI 與 Anthropic 等西方 AI 實驗室正大量採用 DeepSeek 開源的 KV cache 最佳化架構,以降低長文本模型的推論成本。 消息指出,DeepSeek 先前釋出的 MLA 架構將快取壓縮約 15 倍,隨後又推出 Compressed Sparse Attention (CSA) 與 Heavily Compressed Attention。其最新的 DeepSeek-V4.1-Flash 模型進一步採用 CSA2、跨層快取重用(cross-layer cache reuse)、因果編碼-解碼器架構與 FP4 快取技術,將全域 KV cache 降至每 token 僅 890 bytes,與 DeepSeek-V1 相比大幅減少約 437 倍的記憶體占用。 受惠於這些技術,OpenAI 與 Anthropic 近期低調發布了採用相關最佳化技術的新模型。在快取讀取成本方面,Claude Opus 5.5 較 Opus 5 降價 60%,而 GPT-6.1 Sol 則較 7 月下旬的 GPT-5.6 Sol 降價達 80%。據使用者回饋,這兩款新模型在實際使用上的品質,與各自的旗艦模型(Claude Fable 5.1 及 GPT-6 Astra)表現相近。
讀原始報導

社群討論

社群對西方實驗室是否抄襲中國開源技術(如 DeepSeek 的 KV cache 最佳化)以降低快取讀取價格存在分歧,部分人質疑 OpenAI 與 Anthropic 憑藉龐大預算早有自家技術,且推估其推論利潤率高達 95% 以上。多數留言讚賞中國實驗室回歸學術開源精神並促使 LLM 商品化(有網友實測在 RTX 5090 本地跑 Qwen 3.8 27b 可達 170 tokens/s),同時批評美國巨頭為維持壟斷而炒作「軍備競賽」與末日論。也有觀點指出,推論成本驟降反而會打破西方實驗室從 100 億暴增至 1000 億美元 ARR 的上市營收成長神話。