跳到主要內容
2026-09-01 日報
研究與評測

新研究指出滑動窗口注意力結合 Attention Sinks 效能達線性注意力 2 至 10 倍,且無需後訓練

Reddit r/LocalLLaMA綜合 2 家報導多家報導
尚未逐項核實

多個報導來源提及此事;未必是彼此獨立的證據。

Alexia Jolicoeur-Martineau 等人發布最新 arXiv 預印本論文,提出以滑動窗口注意力(Sliding Window Attention, SWA)結合 Attention Sinks 取代 LLM 中的二次注意力(quadratic attention)。該方法最大的特點是完全不需要進行後訓練(post-training),即可作為解決 LLM 二次成本問題的簡單替代方案。 根據論文數據,在 Needle-in-a-Haystack 與 BABILong 等長文本推理基準測試中,SWA 的效能比各實驗室耗費算力進行後訓練產出的線性注意力(linear attention)變體高出 2 到 10 倍。研究團隊指出,目前將模型後訓練為線性注意力的研究路線,並未與更簡單的基準進行適當比較;此發現預期將大幅改善受限於記憶體容量的本地端 LLM 推理表現。
讀原始報導

背景

滑動視窗注意力機制(Sliding window attention)曾應用於 Longformer 等模型中,用以取代運算量龐大的全局注意力。而注意力池(attention sinks)技術則透過保留少數初始的 sink token 與最近生成的 token,讓模型在推論時能維持固定的記憶體(VRAM)用量。

來源

本期分類