模型發布
World Labs 發布空間智能世界模型 Atlas:支援圖文與 3D 原生輸入,可生成 1 分鐘 1440p 影片
Hacker News綜合 2 家報導多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。

World Labs 宣布推出新一代空間智能世界模型 Atlas,這是一個從頭預訓練的多模態自迴歸擴散 Transformer。Atlas 能原生處理文字、圖像、影片、3D、相機姿態與深度資訊,並將所有輸入整合至共享的 3D 空間脈絡中。
在相機控制生成任務中,模型可根據單張或多張參考圖像,以像素級精度的相機控制生成新視角,最高可輸出長達 1 分鐘的 1440p 影片。在空間重建方面,Atlas 僅需 2 至 3 張圖像即可完成高保真重建,表現超越專門的 3D 重建模型;同時也支援輸入超過百張圖像,以減少模型自行生成的比例並精確還原真實環境。生成的場景可進一步轉換為 Gaussian splats 等實用的 3D 表示格式,以利快速渲染。
此外,Atlas 支援從文字生成圖像與 360 度全景圖,並具備時空模擬能力以實現機器人的 Real-to-Sim 工作流程。該模型未來將驅動 Marble 等 World Labs 旗下產品。
讀原始報導社群討論
社群高度讚賞 Atlas 僅需十幾張照片即可高保真重建 3D 空間的能力,認為將大幅加速遊戲開發與機器人模擬數據生成。針對「世界模型」定義模糊與 3D 一致性的質疑,World Labs 創辦人親自澄清 Atlas 介於渲染器與模擬器之間,能在不依賴點雲或 3DGS 的情況下保持視角一致,並支援不腦補未知區域的「戰爭迷霧」模式。部分網友質疑其動態場景的時間一致性(官方坦承尚待改進),另有洞見指出,從模型潛在空間提取語義資訊可能比單純生成視圖更具實用價值。
來源
- Reddit r/singularityreddit.com