研究與評測
Salesforce 發表 Random Attention:保留提示詞並隨機丟棄 KV Cache,推理吞吐量提升 32-43%
HF Daily Papers一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
Salesforce AI Research 發表「Random Attention」技術,指出在處理長思維鏈(Chain of Thought)時,僅需保留提示詞(Prompt)並在每個注意力頭中隨機丟棄 KV Cache,即可達到與複雜評分壓縮演算法相同的效能。該方法在四款模型與六項推理任務的測試中,追平了現有最強的 KV Cache 丟棄演算法,並在 vLLM 部署環境下將吞吐量提升 32% 至 43%。對照實驗顯示,提示詞是快取中最脆弱且必須保留的部分;而模型的推理軌跡在文本層面(模型會不斷重述所需資訊)與注意力頭之間皆具有高度冗餘,因此隨機抽取即可保留足夠的必要資訊,完全不需要額外計算 Token 的重要性評分。相關程式碼已於 GitHub 開源。
讀原始報導背景
vLLM 是一個用於大型語言模型推論與服務的開源框架,最初由加州大學柏克萊分校開發。該專案的核心技術為 PagedAttention,這是一種專門針對 Transformer 鍵值快取(KV cache)的記憶體管理方法。