跳到主要內容
2026-08-04 日報
研究與評測

大曉機器人與南洋理工大學 S-Lab 開源 ACE-Data-0:L5 級具身資料集含 1,700 萬幀、200 類任務

InfoQ 中國多家報導
尚未逐項核實

多個報導來源提及此事;未必是彼此獨立的證據。

大曉機器人與南洋理工大學 S-Lab 開源 L5 級多模態具身物理智慧資料集 ACE-Data-0,收錄 1,700 萬幀影像、200 類任務、50 名參與者、7.5 萬個互動片段及兩個真實家庭場景。依大曉提出的具身模型資訊密度分級,L1-L2 資料主要支援基礎預訓練,L3-L4 著重已知任務擬合;ACE-Data-0 被歸為 L5,納入接觸壓力、自然發生的猶豫與恢復過程,以及家庭場景中的開放行為變數。 資料集同步採集第一人稱影像、多視角第三人稱影像、全身與手部動作、物體六自由度軌跡、多通道音訊及觸覺訊號,並將各模態對齊至同一時間線與空間座標系。參與者佩戴的第一人稱設備可記錄四路魚眼影像、IMU、頭戴設備位姿、全身動作及手部關節狀態;外部攝影機則補足遮擋區域,觸覺設備記錄全手掌壓力、接觸與滑動資訊。 ACE-Data-0 以桌面尺度與房間尺度兩套系統互補採集。桌面系統聚焦抓取、傾倒、擦拭、切割與折疊等精細手—物互動;房間系統覆蓋廚房、餐廳、客廳及臥室,記錄跨區域移動、全身動作與長時間連續任務。兩套系統共用資料同步、空間標定、品質檢查及標註流程。 資料涵蓋三類任務:原子級人—物互動每次約 3 分鐘;由多個動作組成的家庭活動鏈可持續 20 至 30 分鐘;人—場景互動約 5 分鐘。採集採用目標級指令,只指定最終任務,不限制物品選擇、操作順序與移動路徑,因此保留參與者改變計畫、返回前一步、處理意外及恢復任務等自然差異。 資料集另提供攝影機參數、同步時間線、人體與手部狀態、物體網格與六自由度位姿、邊界框、運動軌跡、手—物接觸資訊,以及與物理時間線對齊的自然語言描述;大量標註直接來自經過標定的採集系統,而非完全依賴模型事後估算。 大曉並以 ACE-Data-0 建立三級具身感知評測基準,分別檢驗從視覺推斷接觸與觸覺訊號、在遮擋及持續運動下恢復人體與手部狀態,以及從第一與第三人稱影像理解接近、抓取、調整和釋放等完整互動。團隊評測 30 多種代表性方法後發現,現有模型在接觸感知、嚴重遮擋、第一人稱自運動、極端視角及長時間任務上仍有明顯能力缺口。資料可用於模仿學習、世界模型、視覺—語言—動作模型(VLA)、機器人策略學習,以及將人類示範遷移至不同機器人本體。
讀原始報導

來源