研究與評測
新研究提出 Prefix Sliding 技術:丟棄無用中間 token 降低推論記憶體成本,免訓練即可提速 3 倍
HF Daily Papers一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
最新論文提出 Prefix Sliding 技術,透過在推論過程中丟棄不重要的中間 token,解決 Test-time Scaling 因保留完整推論軌跡而導致的高昂記憶體成本。該方法僅保留包含關鍵指令與可用工具的「前綴(prefix)」,以及模型當前正在處理的「最近數千個 token 視窗」,藉此設定總記憶體需求的上限。在不重新訓練的情況下,Prefix Sliding 能維持現有模型效能並將速度提升 3 倍。若結合強化學習進行訓練,模型可擴展至處理超過 10 萬個 token 的推論軌跡。消融實驗顯示,此方法的表現優於總結中間 token 或傳統的滑動視窗(vanilla sliding window),相關程式碼已於 GitHub 開源。
讀原始報導