World Labs 發布空間智能世界模型 Atlas:支援圖文與 3D 原生輸入,可生成 1 分鐘 1440p 影片
採用自迴歸擴散 Transformer 架構,Atlas 僅需 2 至 3 張照片即可精確重建場景,並輸出 Gaussian splats 格式。
Hacker News綜合 2 家多家報導
68 則值得知道的變化
採用自迴歸擴散 Transformer 架構,Atlas 僅需 2 至 3 張照片即可精確重建場景,並輸出 Gaussian splats 格式。
影像經壓縮後以最高 384 個 Token 進入語言主幹,系統並為視覺特徵獨立修改了注意力滑動窗口與專屬 MoE 專家分配路徑。
整合 Nano Banana 模型,主打點擊物件局部修改與 4K 放大,已內建於 Docs 與 Slides,即日起向企業用戶釋出。