跳到主要內容
2026-08-22 日報
研究與評測

Nvidia 提出跨模型 KV Cache 轉移技術,以線性映射免除重新計算,速度最高提升 25 倍

VentureBeat單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,Nvidia 研究人員提出跨模型 KV Cache 轉移技術,解決 AI 代理系統在不同大小模型間切換時,接收模型必須重新計算整個對話(Prefill 階段)的成本與延遲瓶頸。 該技術透過簡單的線性數學,將來源模型的 KV Cache 直接映射到目標模型中,無需依賴基於梯度的訓練或嚴格的架構限制。實驗顯示,在相容的模型對上,此線性映射過程比重新計算對話快 2.7 到 25 倍,並保留高達 98% 的目標模型獨立準確度。 此技術支援雙向轉移:可從小模型切換至大模型以處理複雜推理,或由大模型處理完長篇提示詞後,降級至小模型進行後續對話以節省成本。 目前的初步研究聚焦於同家族模型內的轉移(如 Qwen、Llama 或 Ministral 家族),這些模型共享分詞器(Tokenizer)與核心架構,僅在參數規模上有所差異。
讀原始報導

背景

代理型 AI(Agentic AI)具備自主執行目標與使用軟體工具的能力,與僅執行特定問答任務的傳統 AI 不同。然而,當這類系統在不同語言模型間切換時,接收端模型必須重新計算對話歷史以建立鍵值快取(KV cache),這項記憶體管理挑戰已成為大型語言模型擴展部署的主要瓶頸。

來源

相關主題