跳到主要內容
2026-08-13 日報
研究與評測

紫東太初團隊推出免訓練視覺 Token 剪枝方法 GMC,減少 80% Token 仍保留近 98% 效能

量子位單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

中國科學院自動化研究所紫東太初團隊推出核心集剪枝方法 GMC(Grounded Message Coreset Pruning),旨在解決多模態模型中視覺 Token 冗餘導致的記憶體開銷與推理延遲問題。GMC 採免訓練、無額外依賴設計,可直接相容 Qwen 與 LLaVA 等主流視覺語言模型。該方法透過「互補證據自適應篩選」與「群體互補資訊傳輸」雙階段架構,將待刪除 Token 的隱藏狀態聚合至代表 Token,避免傳統 Top-K 篩選直接刪除低分 Token 所導致的細節遺失。在 Qwen2.5-VL-7B 模型實測中,GMC-H2 將視覺 Token 減少 80.2%(僅留 256 個)時,仍保留 97.78% 的平均能力;GMC-L16 減少 90.1% Token 時,效能達 99.11%。在 LLaVA-1.5-7B 上保留 64 個 Token 時效能達 99.82%。此外,在包含 15,876 個 Token 的長文件問答場景中,GMC 減少了 73.94% 的提示 KV Cache,端到端推理加速 1.258 倍,並在 POPE 與 HallusionBench 等基準測試中有效抑制視覺幻覺。
讀原始報導

背景

視覺語言模型在處理影像時會產生大量視覺 Token,並長期佔用 KV Cache。KV Cache 是一種藉由記住重要資訊來加速推論過程的技術,但過多的 Token 冗餘會導致記憶體開銷大與推論速度變慢,成為多模態模型落地的核心瓶頸。

來源

本期分類