開發生態
分析指 DeepSeek v4 Flash 開源 Disk KV cache 架構,5% 快取命中率差異可致 3 至 4 倍成本落差
X @Xianbao_QIAN單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據社群技術分析指出,DeepSeek v4 Flash 的 Disk KV cache 架構被視為大幅降低推論成本的關鍵,且該架構已完全開源,其他業者可快速導入於下一代模型訓練。分析以快取命中與未命中價差 50 倍為假設基準,指出 90% 與 95% 僅 5% 的快取命中率差異,即可導致單一 token 的價格產生 3 至 4 倍的落差。該評論認為,DeepSeek 長期致力於縮小 KV Cache 體積並延長其保存時間,此舉將有助於降低全行業的推論服務成本。
讀原始報導背景
深度求索(DeepSeek)團隊過去曾於半年內發布並開源多個百億級參數的大型語言模型。此次引發討論的 DeepSeek v4 Flash 主打 Disk KV cache 功能;將 KV Cache 卸載至磁碟的技術,能將完整快取存於磁碟中並利用記憶體內的元資料預測載入,藉此大幅提升記憶體效率。