模型發布
Unitree 發布 6B 具身基礎模型 UnifoLM-WLA-1.0,單一模型支援 64 項全身與桌面任務
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 社群消息指出,Unitree Robotics 發布 6B 參數的通用具身基礎模型 UnifoLM-WLA-1.0。該模型以約 2500 小時的真實機器人數據訓練,單一模型即可處理 10 項全身任務與 54 項桌面任務(共 64 項),並支援平行夾爪與兩款不同的靈巧手。
在架構設計上,UnifoLM-WLA-1.0 以基於 Qwen3-VL 的具身推理模型 UnifoLM-ER-1 為起點,透過光流(optical flow)與 VQ-VAE 加入未來動態區域預測。動作控制部分,模型使用殘差 VQ 將末端執行器、手部與下半身動作離散化,並在頂層加入 MMDiT 動作專家模型以進行連續控制。
消息指出,該模型已在 Unitree G1 人形機器人上運行,展示了鋪床、操作洗衣機、摺衣服與物品分類等實際操作能力。
讀原始報導背景
視覺-語言-動作模型(VLA)是一種多模態基礎模型,主要用於機器人學習領域以整合視覺、語言與動作。這類模型通常透過微調視覺語言模型(VLM)打造,採用端到端架構,能直接接收環境影像與文字指令,並輸出供機器人執行的低階動作。