跳到主要內容
2026-09-10 日報
研究與評測

RoboTracer 以 (u, v, d) 取代 XYZ 生成 3D 機器人軌跡,TraceSpatial-Bench 成功率最高報 45%

AI 科技評論單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 AI 科技評論報導,北京航空航天大學、北京大學、智源研究院與中國科學院自動化研究所等團隊提出 RoboTracer,讓 VLM 將指令拆成帶物理尺度的多步 3D 軌跡,再交由運動規劃器執行;其核心表徵不是直接預測絕對三維座標 (x, y, z),而是以圖像座標加度量深度 (u, v, d) 表示軌跡。下游取得相機內參後,可將 (u, v, d) 投影為 3D 物理座標;報導稱消融實驗中,這種表徵在精度與遷移能力上優於直接預測 (x, y, z)。 RoboTracer 另以專用 <SCALE> 標記與輕量 MLP 解碼器估計真實物理尺度,SFT 階段在對數空間進行回歸。團隊表示,最初統一要求模型以「公尺」輸出反而效果較差,允許依上下文選擇公尺、公分、英吋等單位後,尺度估計精度有所提升。模型可只使用單目 RGB,也能額外接入相機內參與深度等幾何資訊;在 TraceSpatial-Bench 中,RGB 加過程獎勵的 2B-RFT 版本成功率報 39%,加入內參與深度後升至 45%。 針對多步軌跡推理,RoboTracer 採用免額外過程獎勵模型的規則化機制,配合 GRPO 微調,要求模型在輸出軌跡前逐步產生感知證據。規則包含結構化格式校驗,以及依不同感知屬性計算的精度獎勵;材料列出的容忍條件包括像素誤差 10% 以內,以及深度、尺寸估算在 ±30% 以內,且不強制感知步驟採固定先後順序。 團隊同時建立 TraceSpatial,據報包含約 450 萬個樣本與 3000 萬個問答對。資料來自三條管線:其一清洗約 170 萬張開源 2D 圖片,以 MoGe-2 估計深度、SAM 2.1 進行實例分割,再重建偽 3D 場景;其二從 3D 掃描場景以 RRT* 等方法自動產生包含避障的操作軌跡;其三整合 DROID、AgiBot 真實機器人操作影片及 RoboTwin 2.0 仿真資料,經深度一致性與動作分割清洗後取得物體中心及末端執行器的 3D 軌跡。 團隊另建立含 100 個真實複雜室內場景的 TraceSpatial-Bench,每個樣本要求完成 3 至 8 步複合度量推理並產生無碰撞 3D 軌跡。依報導所列結果,Gemini-2.5-Pro、Qwen3-VL-4B、Qwen3-VL-8B 的綜合成功率分別為 3%、6%、8%,RoboTracer 的 RGB 加過程獎勵版本為 39%,加入相機內參與絕對深度後為 45%;另一組既有空間理解、度量與指代基準上,RoboTracer SFT 後平均成功率約 79.1%,較 Gemini-2.5-Pro 高約 11 個百分點,兩組數字屬不同評測,不宜直接混用。 真機部分,RoboTracer 輸出的是高層 3D 軌跡而非底層關節力矩,再由運動規劃器與即時感知模組執行,因此同一套 (u, v, d) 表徵可接到 UR5 與 Unitree G1,而不必為不同本體重訓 RoboTracer。材料中的 UR5 桌面測試約以 1.5 Hz 依視覺畫面重新計算軌跡;人為移動目標或障礙物後,由外部監控系統偵測變化並觸發重規劃,因此這並非 RoboTracer 原生的高頻閉環控制。上述方法、資料規模與評測結果目前均依單一媒體對論文及作者訪談的報導整理,材料未提供其他獨立佐證來源。
讀原始報導