模型發布
史丹佛於 RSS 2026 發表 3D 世界模型 Point-World,僅需 15 小時微調;NVIDIA 同場推出全模態 Cosmos 3 佈局邊緣部署
AI 科技評論綜合 4 家報導單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
7 月 13 日,2026 年機器人頂級學術會議 RSS(Robotics: Science and Systems)於澳洲雪梨開幕,本屆主會僅接收約 160 篇論文。在「Robot World Models」工作坊中,學界與業界聚焦具身智慧如何擺脫對海量標註資料的依賴,轉向少樣本與強泛化能力。
史丹佛大學李飛飛實驗室的黃文龍發表了 3D 世界模型 Point-World,提出以「反事實推理」與「腦內搜索」取代傳統的演示學習。該模型給定 RGB-D 輸入與機器人描述文件(URDF),將機器人動作空間統一定義為「3D 點雲流(3D Point Flows)」。Point-World 基於 Transformer 架構,作為零樣本(Zero-shot)真實世界模擬器,無需物體分割即可處理剛體、流體與布料等可變形物體,並能隱式識別關節結構與推斷遮擋時的接觸幾何關係。
在資料擴充方面,史丹佛團隊對 Joy 資料集進行重新標註,生成約 3500 小時具備深度資訊與相機位姿的 3D 點雲。實驗數據顯示,利用 2D 影片資料進行預訓練,再配合僅 15 小時的 3D 互動資料進行微調,Point-World 的環境動力學預測能力便超越過去 500 小時的訓練成果,並能在未見過的環境與機械臂上保持極高的物理保真度。
同場工作坊中,NVIDIA 物理 AI 專家 Max Li 發表了全新產品 Cosmos 3。這是全球首個在單一 Transformer 架構下,完全打通文字、視覺、音訊與動作全模態的世界基礎模型。Cosmos 3 旨在將具身智慧的運算從雲端資料中心轉移至邊緣側,支援在 Jetson 等邊緣設備上即時運行,推動機器人控制的軟硬體一體化。
讀原始報導背景
史丹佛大學研究員黃文龍先前曾提出 VoxPoser 與 ReKep 等具身智能里程碑研究,例如 ReKep 便是將環境中的 3D 關鍵點映射為 Python 函式,以處理機器人操作的空間約束。他近期的研究則進一步轉向以 3D 幾何空間為基礎的世界模型,讓機器人能在實際動作前進行反事實推理。