研究與評測
Yann LeCun 於 ECCV 2026 演講批「預測像素」為偽命題,押注 JEPA 架構並創立 AMI Labs
AI 科技評論單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據報導,Yann LeCun 於 ECCV 2026 發表題為《World Models: Enabling the next AI revolution》的主題演講,指出僅靠語言與 token 訓練無法跨越物理世界的門檻,並宣布於近期創立新公司 Advanced Machine Intelligence(AMI Labs)以推動世界模型發展。
LeCun 指出,一名四歲兒童接收的視覺數據量(約 10¹⁴ 位元組)已等同網際網路所有公開文本的總和,顯示純文本訓練的 Scaling Law 已觸及天花板。他認為當前大語言模型僅具備被動反應的「系統 1」能力,在生成 token 時缺乏內部推理。
針對目前業界發展世界模型的四條路線,LeCun 點出核心分歧:Sora 與 Genie 押注從像素湧現物理規律;World Labs 鎖定底層三維一致性;NVIDIA Cosmos 與 Omniverse 依賴顯式物理引擎;而他則押注 JEPA(聯合嵌入預測架構)。LeCun 認為「預測像素」是偽命題,因為畫面中充滿不可預測的細節(如鏡頭外走入的人),AI 應捨棄生成式路線,編碼器需丟棄不可預測的細節,改在抽象表徵空間中預測未來。
在具體實作上,JEPA 採用基於能量(energy-based)的模型作為生成式 AI 的替代方案。系統不會直接生成答案,而是透過外部搜尋與最佳化,計算出能量分數最低(代價最小)的動作序列,進而實現具備預測與規劃能力的「系統 2」。
官方資料補充顯示,JEPA 架構目前已具體發展出 I-JEPA、V-JEPA 與 V-JEPA 2 等版本。其中,V-JEPA 2 作為首個基於影片訓練的世界模型,已能讓機器人在新環境中實現零樣本(zero-shot)控制。
讀原始報導背景
JEPA(聯合嵌入預測架構)是圖靈獎得主 Yann LeCun 提出的一種非生成式 AI 架構,旨在透過抽象表徵空間來預測未來,而非逐一預測像素。該技術目前已發展出 I-JEPA、V-JEPA 及 V-JEPA 2 等版本,被視為讓 AI 理解物理世界並建立世界模型的重要路徑。