跳到主要內容
2026-08-29 日報
研究與評測

大曉機器人與香港大學發布 StreamPI,為 VLA 模型引入流式時序快取,真機猜杯子成功率達 80%

AI 科技評論單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

大曉機器人聯合香港大學發布連續多模態時序建模方法 StreamPI,旨在解決 VLA(Vision-Language-Action)模型依賴單幀決策的瓶頸。StreamPI 不依賴額外參數堆疊,而是基於 π0.5 等現有 VLA 骨幹重構注意力機制。該方法將每個時刻組織為「視覺觀測 + 任務指令」時序單元,並採用流式推論(Streaming Inference),將首幀觀測編碼存入鍵值快取,後續僅處理新資訊並調用歷史表示,避免重複計算整個觀測窗口。 為適應真實世界相機與機械臂的時間延遲波動,StreamPI 引入隨機時間間隔訓練(Random-Interval Streaming Training),隨機改變歷史觀測間距並隱藏部分早期資訊。在 LIBERO 測試中,三幀輸入平均成功率從 96.4% 提升至 97.5%,依賴長程上下文的 LIBERO-Long 成功率從 π0.5 的 92.4% 提升至 95.0%。在 CALVIN 測試中,平均連續任務長度達 4.547,超越 π0.5 的 4.313;推進至第五步時成功率仍達 85.0%。 在基於 100 條人類遙操作示範的真機任務中,需要持續記憶軌跡的「猜杯子」任務成功率從 π0.5 的 46.7% 提升至 80.0%;滾動物體抓取從 26.7% 提升至 63.3%;窄瓶口插筆從 40.0% 提升至 66.7%;紙杯插入杯套從 60.0% 提升至 92.0%。團隊未來計畫探索超過 100 幀的高效時序訓練與自適應快取裁剪。
讀原始報導
本期分類