跳到主要內容
2026-08-07 日報
研究與評測

視啟未來創辦人張磊定調世界模型標準:須以動作為輸入條件,並於隱空間引入物體結構

AI 科技評論單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,IDEA 研究院講席科學家、視啟未來創辦人張磊受訪時指出,真正的「世界模型」必須具備動作依賴(Action Conditioned),即模型必須能回答「執行特定動作後環境的變化」。他強調,僅將語言模型的 Next Token Prediction 改為 Next State Prediction 並不嚴謹,必須加入動作前提,才能符合強化學習的需求。 基於此標準,張磊指出早期的 Sora 等純影片生成模型因未對動作進行建模,僅預測像素變化,無法直接協助機器人與環境互動,因此不屬於世界模型。此外,近期熱門的 World Action Model(WAM)因採用「先生成未來畫面再反推動作」的先果後因模式,無法用於強化學習,同樣不符定義。 針對技術路線,張磊支持 Yann LeCun 的隱空間(Latent Space)路線,而非追求像素逼真的路線。他認為隱空間能排除光影等非物理規律驅動的細節,有助於模型學習狀態變化背後的本質規律。與 LeCun 路線的關鍵差異在於,張磊團隊在其基礎框架的隱空間中引入了「物體結構」。透過團隊先前開發的開放世界物體感知模型 DINO-X,將獨立物體作為世界模型預測與規劃的基本單元,讓隱空間表徵直接理解物體,進而更有效地學習物理規律。 針對具身智能發展,張磊表示當前最大瓶頸在於「大腦」而非硬體本體。目前單一場景 70% 至 80% 的成功率意味著每五次操作就有一次失敗,仍需大量人力兜底;且當前模型缺乏對物理世界的因果推斷與常識理解,尚未達到可獨立部署的標準。
讀原始報導
本期分類