跳到主要內容
2026-08-06 日報
模型發布

據報小米開源機器人基礎模型 Xiaomi-Robotics-1,經 10 萬小時軌跡訓練並結合 Qwen3-VL 與 DiT

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據社群消息指出,小米發布全新的機器人基礎模型 Xiaomi-Robotics-1(XR-1),相關程式碼、論文與模型權重已在 GitHub 與 Hugging Face 公開。XR-1 為視覺-語言-動作(VLA)模型,經過超過 10 萬小時的真實世界操作軌跡訓練,專為未知環境中的開箱即用移動操作及高效適應新任務所設計。 該模型採用類似大型語言模型的兩階段訓練範式,包含廣度預訓練與對齊後訓練,其預訓練擴展行為能可靠轉移至真實世界的機器人表現,且未出現飽和跡象。在架構設計上,XR-1 透過混合 Transformer(MoT)將預訓練的視覺語言模型(Qwen3-VL)與擴散 Transformer(DiT)結合;其中 DiT 的層數與 VLM 相同,但採用較小的隱藏層大小(hidden size)以加快推論速度。
讀原始報導

背景

Diffusion Transformers (DiTs) 是一種具備擴展性的模型架構,研究中常透過運算複雜度(如 Gflops)來分析其效能。小米此次發布的機器人基礎模型即結合了視覺語言模型與 DiT 架構,應用於真實環境的操作任務。

來源