研究與評測
NUS Show Lab 發表具身模型底座 Show-o,單一 Transformer 融合自迴歸與離散擴散機制
AI 科技評論單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 AI 科技評論報導,NUS Show Lab 負責人壽政教授於 ECCV 2026 發表具身大模型底座 Show-o 系列,首度在單一 Transformer 架構中打通自迴歸(AR)預測與離散擴散(Discrete Diffusion)生成機制。該架構在生成圖像或影片時切換至基於離散 Token 的擴散模式(Mask-and-Predict),僅需十幾步迭代即可一次性恢復完整視覺 Token,避開傳統自迴歸生成圖像的運算開銷。針對具身智慧的資料稀缺問題,團隊提出循環一致性監督(Cycle Consistency),讓模型透過「觀察-描述-再合成」的自監督閉環從無標籤影片中學習。
進階的 Show-2 版本則針對連續影片生成開發通用 3D Tokenizer,統一編解碼圖像與影片。其文本部分沿用因果單向注意力,視覺部分則採用時空雙向注意力機制提升連貫性;內部採用雙路徑架構,在共享 3D Encoder 後拆分理解與生成路徑,並於理解路徑加入語義層(Semantic Layer)進行特徵蒸餾與對齊。在機器人部署方面,團隊將架構延伸至視覺-語言-動作模型(VLA)與世界動作模型(WAM),並指出雲端大模型單次決策延遲達 8 至 20 秒,需搭配端側微調模型才能在自動化雙臂協作等任務中實現近乎即時的低延遲控制。
讀原始報導