跳到主要內容
2026-08-07 日報
研究與評測

李飛飛與 Yilun Du 發表 MVA 論文:將動作轉為像素遮罩,微調 Wan2.2 15 小時實現機器人跨本體操作

AI 科技評論單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,李飛飛、Yilun Du、吳佳俊與 ControlNet 作者張呂民等學者聯手發表《Masked Visual Actions for Unified World Modeling》(MVA)論文,提出機器人無需專屬大模型,可直接利用現有影片生成模型。 該方法透過 SAM(Segment Anything Model)將影片中的機器人與操作物體分割,把動作轉換為連續變化的像素遮罩軌跡。藉由遮蔽物體或機械臂的軌跡,單一模型即可在「推演世界變化(世界模擬)」與「反推機器人動作(動作生成)」兩種任務間切換。 研究團隊未從零訓練模型,而是採用 140 億參數的開源影片生成模型 Wan2.2 作為基底,僅使用 15 小時的資料透過 LoRA 進行微調。實測顯示,MVA 在衡量生成與真實畫面差異的 LPIPS 評分達 0.0945,優於對比方法 Ctrl-World 的 0.362。 在執行層面,MVA 導入機器人的 URDF(統一機器人描述格式)文件,先預測末端位置,再透過逆運動學(IK)反算關節角度,取代直接輸出關節角度的傳統作法。此設計不僅限制了模型生成物理上不可行的姿態,更讓僅用單臂機器人資料訓練的模型,能直接在未見過的雙臂機器人上成功執行任務,解決跨本體的泛化難題。
讀原始報導
本期分類
相關主題