跳到主要內容
2026-07-25 日報
研究與評測

RSS 2026聚焦具身路線分歧

量子位據報導
據量子位現場訪談,RSS 2026研究者認為具身智慧產業仍未成熟,VLA與世界模型也非相互取代,而可能形成混合架構。討論指出,世界模型能否有效支援機器人動作,以及資料的篩選、配比與整理,可能比單純擴大資料量更關鍵。這些觀點來自個別研究者與從業者,彼此亦有分歧,尚不代表產業共識。
讀原始報導

背景

VLA(視覺-語言-動作)是整合視覺、語言與動作的多模態模型,目前被視為具身智慧模型的主流架構。相較之下,世界模型著重理解物理世界、預測未來狀態與動作後果,並據此支援規劃及持續修正。

來源