跳到主要內容
2026-08-04 日報
研究與評測

港科大(廣州)團隊據報開源 FreeOcc:免訓練建構開放詞彙 3D 占據地圖,RGB-D 達 34.40 IoU

AI 科技評論單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,香港科技大學(廣州)與穆罕默德・本・扎耶德人工智慧大學(MBZUAI)研究團隊提出 FreeOcc,稱其為首個免訓練的開放詞彙 3D 占據預測系統,可僅憑單目或 RGB-D 影像序列,在線建構全域一致且支援任意文字查詢的 3D 占據地圖;論文已獲 RSS 2026 接收,程式碼與資料集均已開源。FreeOcc 論文的 arXiv 頁面標示日期為 2026 年 4 月 30 日。 FreeOcc 不需占據真值、語意標註或真實相機位姿,也不針對特定資料集訓練占據預測模型。系統由四層地圖組成:SLAM 建立全域一致的半稠密點雲並估計相機位姿;3DGS 以點雲為幾何錨點補充稠密結構;預訓練視覺語言模型把開放詞彙語意特徵關聯至 Gaussian primitives;最後透過機率式 Gaussian-to-Occupancy 投影,產生體素占據機率與文字類別匹配分數。 為降低傳統 3DGS 偏重渲染、幾何邊界容易漂移的問題,FreeOcc 採用 Geometry-aware Initialization(G-ini)與 Geometrically Anchored Gaussian Updates(GAGU),將高斯中心持續錨定於 SLAM 重建點,並沿觀測射線進行各向異性初始化。正文以 DROID-SLAM 為骨幹,補充實驗另測試 MASt3R-SLAM 與 VGGT-SLAM。 在 EmbodiedOcc-ScanNet 上,FreeOcc 單目版達 31.29 IoU/13.86 mIoU,RGB-D 版達 34.40 IoU/15.84 mIoU。作為對照,自監督方法 GaussianOcc 與 GaussTR 仍需真實相機位姿,成績分別為 10.17/4.34 與 15.63/4.95;報導稱 FreeOcc 在 IoU 與 mIoU 均超過既有自監督基線兩倍。 團隊另建立跨資料集泛化基準 ReplicaOcc,以 Replica 場景的 RGB-D 序列與全域占據真值評估零樣本遷移,並採用比 EmbodiedOcc-ScanNet 的 11 個粗粒度類別更細緻的語意類別。在此基準上,FreeOcc 單目版達 46.81 IoU/16.93 mIoU,RGB-D 版達 55.65 IoU/20.90 mIoU;報導指出,從 EmbodiedOcc-ScanNet 遷移的監督式 EmbodiedOcc 語意 mIoU 幾乎降至零,GaussianOcc 與 GaussTR 也幾乎無法產生有效的語意占據結果。 將不同 3DGS-SLAM 系統的高斯地圖統一轉換為占據體後,FreeOcc 在 ReplicaOcc 與 EmbodiedOcc-ScanNet-mini 的幾何評測中,單目平均 IoU 為 39.34、RGB-D 平均 IoU 為 45.24;報導稱兩項均優於 Photo-SLAM、MonoGS 與 DROID-Splat。
讀原始報導

背景

既有以學習為基礎的三維占據預測方法,通常仰賴大規模三維標註,且跨環境泛化能力有限。FreeOcc 可從單目或 RGB-D 影像序列逐步建立全域一致的三維占據地圖,不需要三維占據標註、語意標籤、真實相機位姿或額外訓練。

來源

本期分類