跳到主要內容
2026-09-15 日報
模型發布

深度機智開源物理基座模型 PhysBrain 1.5,28 項基準測評獲 72.5 分,差距 GPT-6 Astra 不到 1 分

量子位單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,中國 AI 公司深度機智(DeepCybo)於 2026 年 9 月 9 日發布並開源物理基座模型 PhysBrain 1.5。在包含視覺空間感知、具身認知與規劃等五大維度的 28 項公開基準測試中,PhysBrain 1.5-8B 取得 72.5 的綜合均分,位居開源模型首位,超越 Hy-Embodied-VLM-1.0(66.0),且與閉源模型 GPT-6 Astra(73.3)及 Gemini 3.6 Flash(73.0)的差距在 1 分以內。 在單項成績方面,該模型於 RoboSpatial-Home 空間理解獲 73.9 分、Part-Affordance 可操作部位識別獲 84.0 分、RoboRefit 視覺目標定位獲 89.8 分。官方同步於 Hugging Face 與 GitHub 開放技術報告、評測工具包以及 8B 與 2B 兩種規模的模型權重;其中 2B 版本在同套測試中取得 66.6 分。 PhysBrain 1.5 將具身理解、動作生成與未來狀態預測整合於同一訓練框架。給定畫面與指令後,模型可預測 1 秒後的物理狀態,並同步輸出 RGB 影像、深度圖與機器人遮罩(Mask)。在動作生成上,模型透過 Human-as-Humanoid 轉換框架學習人類手腕運動,將人類行為資料轉化為機器人動作,並已在 60 自由度的 Prime U 擬人機器人上實現零樣本(Zero-shot)遷移。 補充資料顯示,PhysBrain 1.0 的相關研究於 2026 年 5 月發布,核心為將人類第一人稱影片轉化為物理常識監督;1.5 版本則進一步透過 E2E-3M 資料集混合一般視覺語言資料進行監督式微調(SFT),並結合 Ego360 人類全景真實資料體系(包含全身姿態、手部運動與任務語音)進行訓練。 報導另引述 Robocurve 實驗指出,當前頂尖模型在具身任務上仍有落差,例如 GPT-6 Astra 在「積木放入碗」任務成功率達 19/20(Claude Fable 5.1 為 8/20),但在毫米級精細插入任務的成功率則降至 10%。
讀原始報導

背景

PhysBrain 是一個以第一人稱視角(egocentric)為中心的視覺語言模型(VLM)基底,專注於具身智能與物理常識。該模型透過將大規模人類第一人稱影片轉化為結構化的物理常識監督,藉此強化機器人在真實環境中的理解、推理與規劃能力。

來源