跳到主要內容
2026-08-27 日報
研究與評測

IJCAI 2026 論文提出 AC²-VLA 加速框架:以動作上下文調度計算,推理速度提升 1.79 倍

AI 科技評論單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,IJCAI 2026 收錄論文提出 AC²-VLA(Action-Context-Aware Adaptive Computation)框架,旨在解決 VLA(視覺-語言-動作)模型推理延遲過高、難以保證即時控制頻率的問題。 有別於傳統依賴視覺複雜度來刪減計算量的方法,AC²-VLA 改以「動作上下文」作為調度訊號。模型將視覺觀測、語言指令 embedding 與上一時刻動作資訊組合成先驗條件向量,輸入至統一的路由器(router)。該 router 負責統籌三項自適應計算策略: 1. 認知快取復用(cognition caching):當動作狀態穩定且視覺狀態匹配時,跳過 VLM 骨幹網路計算,直接將快取特徵送入 action head。 2. 視覺 token 剪枝(token pruning):依動作階段為 token 打分,剔除不相關區域以縮短序列長度。 3. 層跳過(layer skipping):依動作上下文判斷所需網路深度,動態跳過不需要的 Transformer 層。 在訓練方面,AC²-VLA 採用自蒸餾(self-distillation),以在 Open X-Embodiment 資料集訓練過的稠密模型為 teacher,讓稀疏化後的 student 模仿其動作輸出與特徵表示,使其具備跨骨幹網路的可遷移性。 實驗數據顯示,基於 CogACT 構建的 AC²-VLA 在 SIMPLER 仿真基準(Google Robot Visual Matching 設定)測試中,計算量(FLOPs)降至原始模型的 29.4%,實際端到端推理速度提升 1.79 倍。加速並未導致精度下降,四項任務平均成功率達 76.8%,超越稠密基線 CogACT 的 74.8% 與 RT-2-X 的 46.3%;其中 Drawer Opening 任務成功率由 71.8% 升至 80.6%。 消融實驗證實三項機制缺一不可。此外研究發現,若設定快取閾值 τcache = 0.2,特徵復用帶來的時間一致性可減少高頻視覺雜訊導致的動作抖動,使成功率進一步提升至 87.1%。
讀原始報導
本期分類