模型發布
智在無界發布隱式觸覺世界動作模型 Being-H0.8,整合視覺與觸覺至隱空間且訓練成本僅影片生成 1%
AI 科技評論單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據報導,北京大學副教授盧宗青創立「智在無界(BeingBeyond)」,並發布全球首個隱式觸覺世界動作模型 Being-H0.8。
Being-H0.8 首次將觸覺模態引入大規模模型預訓練,將視覺、觸覺、動作及未來狀態變化統一至同一隱空間(latent space),使機器人能理解並預測物理交互過程。該模型不生成畫面,直接在 embedding space 中預測狀態與動作;據稱在同等資料與參數規模下,此路線的訓練算力成本僅為像素級影片生成模型的 1%,且推論速度足以支援機器人即時控制。
在訓練資料方面,團隊已累積超過 50 萬小時經篩選的人類第一視角影片資料。盧宗青指出,人類影片是具身智慧唯一能 scale up 的資料路徑,並認為僅靠單一機器人本體收集資料的「資料飛輪」容易過度擬合(overfit)特定硬體構型,難以通向通用基礎模型。
其前代預訓練模型 Being-H0.5 已可適配雙足人形、雙臂、機械臂、夾爪與靈巧手等多種硬體構型。目前,智在無界已與地瓜機器人展開合作,進行端側世界模型的部署。
盧宗青亦表示,具身基礎模型的確定性技術範式尚未出現,預期產業需 2 至 3 年才會出現具備真實商業投資報酬率(ROI)的落地應用,而達到類似 GPT-3.5 階段的通用具身基礎模型則需 3 至 5 年。
讀原始報導