跳到主要內容
2026-07-19 日報
模型發布

ReViV統一重建第一人稱4D

HF Daily Papers
ReViV 提出首個整合式第一人稱 4D 重建框架,可從單目 RGB 影片同步重建相機軌跡、視線、全身與手部動作及深度。其 Masked Generative Egocentric Transformer 採單一前饋架構,在多項基準的準確度與效率達到最佳或具競爭力表現,且不依賴繁重的任務特定先驗。程式碼與模型已完整開源。
讀原始報導

背景

穿戴式前向相機可從第一人稱視角記錄使用者與環境的連續互動,但既有方法常依賴預先計算的相機軌跡,並將場景感知與使用者運動分開處理。ReViV 採用 Masked Generative Egocentric Transformer,能從單一單眼 RGB 影片,在一次前饋運算中聯合重建身體與手部動作、深度、相機軌跡及注視方向。

來源