跳到主要內容
2026-09-10 日報
研究與評測

群核科技聯合 NVIDIA 與浙大發表三項 ECCV 2026 物理 AI 成果:推出 SPEAR 模擬器、Syn-GRPO 框架與 WalkerBench 評測基準

AI 科技評論單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,群核科技聯合 NVIDIA、Intel、Adobe、浙江大學等機構,發表三篇入選 ECCV 2026 的論文,針對物理 AI(Physical AI)推出模擬器、強化學習框架與評測基準。 在模擬環境方面,推出高保真具身模擬器 SPEAR。該模擬器對接 Unreal Engine (UE) 的 C++ 執行期反射系統,向 Python 開放 14,485 個 UE 原生函數與 53,537 個屬性,程式碼量約 2.7 萬行。SPEAR 採用處理程序間共享記憶體機制實現 Zero-Copy 傳輸,1080P 解析度下渲染速度達 73 FPS,端到端渲染速度比 UnrealCV+ 快 15 倍、比 AirSim 快 12 倍。系統支援與 MuJoCo 物理引擎即時協同模擬,並可操控 6 種具身智能體。 在演算法訓練方面,針對多模態大模型(MLLM)強化學習中的「熵崩潰」問題,團隊推出 Syn-GRPO 框架。該框架利用 BEN2 分割模型與 SDXL ControlNet 重繪模型,在保留目標物理座標的前提下替換背景,線上非同步合成訓練資料,使訓練耗時僅增加約 5%。以 Qwen2.5-VL-3B 為基座測試,Syn-GRPO 在 LISA-Grounding 評測集準確率達 68.28%(標準 GRPO 為 62.24%),在 RefCOCO 資料集達 92.15%。 在空間智能評測方面,推出基於真實街景的互動式評測基準 WalkerBench,覆蓋全球 6 大洲 160 多座城市,並剝離 GPS 與街名資訊。測試顯示,人類受試者導航任務完成率為 69.43%,而未配備輔助框架的頂尖 VLM(如 Claude-Opus-4.6)最高僅 24.49%。 為解決 VLM 空間軌跡記憶崩塌問題,研究團隊提出 Spatial-IDE 框架,包含顯式拓撲記憶(ETM)與目標導向感知(GDP)機制。引入該框架後,9 個受測主流 VLM 平均得分提升 104.97%,其中 Claude-Opus-4.6 完成率升至 43.17%,GPT-5-chat-latest 效能提升 119.98%。該框架已部署於宇樹 G1 人形機器人,在未經特定環境微調下,僅靠單目 RGB 攝影機與自然語言指令,完成真實街道千米級自主導航。
讀原始報導