跳到主要內容
2026-09-24 日報
模型發布

阿里等團隊發布世界模型評測基準 HappyWorld-Bench,涵蓋影片、重建與具身三賽道

AI 前線單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,阿里及合作團隊發布針對世界模型的統一評測基準 HappyWorld-Bench,並同步推出影片生成模型 HappyOyster 2.0 preview。 HappyWorld-Bench 將世界模型能力分為 W1 到 W6 六級:W1(感知連貫)、W2(合理反應)、W3(狀態保持與記憶)、W4(主動修改與反事實)、W5(多代理互動擴展)及 W6(跨環境與跨模態的通用系統)。目前公布的 1692 個評測案例主要覆蓋 W1 到 W5,包含 29 個評測維度,並分為影片、空間重建與具身智慧三條賽道。 在影片賽道中,阿里自家的 HappyOyster 2.0 preview 取得整體領先,Google DeepMind 的 Genie 3 緊隨其後,並在運動約束、鏡像對應和開放互動上表現突出。 在空間重建賽道,GPT-6-Astra 擅長編輯與擴展;World Labs 的 Marble 在桌面支撐等基礎場景構建更穩定;HYWorld-2.0 則在物理連通性領先,其導航網格覆蓋率達 82.7%,高於 Marble 的 53.6%。 在具身智慧賽道,MiniMax-H3 取得領先,在單步操作與連續動作表現較佳,但在 W4 成對反事實任務得分為 88.62。 報導指出,HappyOyster 2.0 preview 支援在生成過程中持續輸入指令以改變場景與動作,但目前尚未對一般消費者開放。HappyWorld-Bench 的程式碼儲存庫、技術報告與 HappyWorld-Arena 評測平台均已公開。
讀原始報導