研究與評測
史丹佛學者吳佳俊於 ECCV 2026 提出多模態融合新框架:以物理屬性統一視聽觸覺
AI 科技評論單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據報導,史丹佛大學計算機科學助理教授吳佳俊於 ECCV 2026 發表專題演講,提出以「物理屬性」為基礎的跨模態感知新範式。該框架不採用將視覺、音訊與觸覺數據直接輸入 Transformer 的常規作法,而是將三種感官視為幾何、材質與剛度等同一組物理屬性在不同觀測通道上的投影,藉此解決面對未知物體時,聲音與觸覺數據趨近於零的痛點。演講中展示了發表於 ECCV 2024 的 PhysDreamer 模型,該模型結合 3D 高斯表示與可微分物質點法(MPM),從預先訓練的影片擴散模型中蒸餾出楊氏模數(剛度)等高維物理屬性場,能針對花朵等非均質軟體預測動作條件下的 3D 動力學軌跡。另一項名為 WonderPlay 的研究則構建了混合式生成模擬器,從單張圖像進行 3D 重建並產出初步物理模擬結果,再將深度圖或光流作為條件輸入影片生成模型進行後訓練。該方法將物理模擬器的輸出作為生成模型的控制介面,支援剛體、流體、軟體及顆粒物體等多種物理互動,使模型能接受細粒度的 3D 動作輸入並生成逼真影片。此外,演講亦提及聲音可微分渲染(DiffImpact、RealImpact)與柔性電子皮膚(DexSkin)等延伸研究。
讀原始報導