跳到主要內容
2026-09-10 日報
研究與評測

極佳視界 7 篇空間智能論文入選 ECCV:發布 VLA-R1 具身決策模型與 OmniNWM 駕駛世界模型

AI 科技評論單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,極佳視界(GigaAI)共有 13 篇論文入選 ECCV,其中 7 篇聚焦空間智能與物理 AI 領域,涵蓋具身決策、世界模型與 3D/4D 重建技術。 在具身決策方面,極佳視界聯合中科院自動化所與清華大學推出 VLA-R1 框架,將強化學習與顯式思維鏈(CoT)引入具身操控。該模型要求在輸出控制指令前先生成文本思維鏈,並透過包含 1.3 萬條標註的 VLA-CoT 資料集注入物理常識。引入 GRPO 強化學習機制後,其可供性區域 IoU 提升至 36.51,軌跡平均誤差降至 91.74。 在自動駕駛領域,聯合上海交大與清華等機構發布 OmniNWM 駕駛導航世界模型。該模型同步生成全景 RGB 影片、語意分割圖、深度圖與 3D Occupancy,並利用全景 Plücker 射線圖將車輛軌跡編碼為像素級控制訊號,內建基於 3D Occupancy 的碰撞與交通規則稠密獎勵函數進行策略評分。 在 3D 與 4D 重建方面,ReconPhys 模型結合 3DGS 與可微物理系統,輸入單目影片不到 1 秒即可輸出綁定剛度、質量與阻尼等物理屬性的 3DGS 資產。MoGe4D 模型則透過 4D-STraG 與 4D-ViSM 模組,從單張圖片推演 4D 動態世界,單張顯示卡約 6 分鐘可生成 4D 影片,並配套發布包含 6 萬組軌跡的 TrajScene-60K 資料集。 在幾何重建與最佳化方面,VolSplat 採用 3D 體素對齊預測取代 2D 匹配以提升幾何一致性;AnchorSplat 透過點錨機制在 0.01 秒內重塑 3DGS 高頻細節;2K Retrofit 則利用熵資訊定位關鍵區域進行稀疏精修,以低算力開銷實現 2K 解析度的 3D 幾何預測。
讀原始報導