跳到主要內容
2026-10-11 日報
研究與評測

字節跳動揭固定分塊 KV-Cache 壓縮具相位敏感性缺陷,字元微調致 DeepSeek 準確率落差達 40.2%

AI 科技評論單一來源
核實資料不足

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

查證回合用盡,未形成有依據結論

字節跳動研究團隊發表論文《Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression》,指出長文本大語言模型採用的固定分塊 KV-Cache 壓縮技術存在「相位敏感性」缺陷,單純在輸入前增加空格或裝飾字元改變切塊排位,即可能導致模型輸出在「天才」與「判斷失效」間劇烈波動。 研究團隊在 DeepSeek-V4-Flash-Base 補全 FP8 量化函數測試中發現,僅在開頭增加無關等號,當等號數量除以 4 的餘數為 0 或 1 時,錯誤率高達 71.3%;餘數為 2 或 3 時,正確率則達 91.5%。在長度 128K Token、包含約 1.6 萬組鍵值對的大海撈針(NIAH)測試中,DeepSeek-V4-Flash-Base 因目標位置不同產生的準確率最大落差達 40.2%,DeepSeek-V4-Pro-Base 落差亦達 34.8%;即便經過後訓練最佳化,兩者仍分別有 19.1% 與 14.8% 的差距。DeepSeek-V4.1-Flash 嘗試將壓縮步長由 4 縮小為 2,雖將差距降至 6.1%,但問題仍未消除。 字節團隊以 Qwen3-0.6B 架構進行消融實驗,將壓縮步長設為 4、6、8、12 時,準確率波動週期皆精準對應步長,而無壓縮的全注意力基線模型則無此現象;即便去除 RoPE 位置編碼或將門控權重改為平均分配,波動依然存在,證實該問題為固定分塊機制的結構性缺陷。 為解決固定邊界問題,業界正嘗試向動態分塊演進。例如香港科技大學(廣州)提出的 ChunkKV 改以完整語義塊為單位壓縮,在 KV 限制為 128 的 NIAH 基準測試中,以 LLaMA-3 為基礎取得 73.8% 準確率,高於 SnapKV 的 58.9%;微軟亞洲研究院研發的 MInference 框架則針對稀疏注意力進行動態匹配,在維持檢索準確率下於百萬字上下文 prefill 階段實現最高 10 倍加速。
讀原始報導

背景

大型語言模型在處理長上下文時,KV Cache 會佔用龐大的顯示記憶體空間,進而大幅推升推論成本。為了降低硬體負擔,業界普遍採用 KV Cache 壓縮與稀疏化技術,透過將上下文切塊處理以減少資源消耗。

這則事件的發展

  1. 2026-10-07DeepSeek 傳獲騰訊與寧德時代領投近千億人民幣融資,並將部署 16 萬顆華為晶片
  2. 2026-10-03據報 DeepSeek 轉向華為算力生態,底層基礎設施面臨「搬家」式轉變

來源

本期分類