跳到主要內容
2026-08-26 日報
研究與評測

ReWorld 發表互動式世界模型架構:分離短期控制與長期記憶,支援 704x1280 即時串流與 64 秒長程回憶

HF Daily Papers一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

ReWorld 提出一種新型互動式世界模型架構,旨在解決控制需要短期視角、而記憶需要無限長度的結構性衝突。該模型在訓練階段將短期控制與長期記憶分離,並在推論階段透過混合注意力視窗(多數注意力頭關注近期,少數全域頭關注完整歷史)與隨機頭路由進行限制。 在推論時,模型採用固定預算的 KV 快取,並搭配姿態索引地標庫(pose-indexed landmark bank),從中檢索最接近當前姿態的地標。其資料引擎將 Unreal 渲染、遊戲漫遊與真實世界影片等 8 種來源對齊至單一物理動作尺度,並利用迴文軌跡(palindrome trajectories)提供記憶訓練所需的重訪數據。 為達成即時互動,ReWorld 透過限制在 LoRA adapter 的分佈匹配蒸餾,將採樣壓縮至 4 步,可串流生成 704x1280 解析度的影片。在與 6 款近期互動式世界模型的對比評測中,ReWorld 取得最佳控制保真度(11.95 度旋轉誤差)與生成品質;在長達 64 秒(384 個 latents)的往返生成測試中,其固定的 12 區塊快取能成功重新生成起始視角,解決了滑動視窗會遺失歷史紀錄、以及全 KV 注意力會耗盡記憶體的問題。
讀原始報導

背景

LoRA(Low-Rank Adaptation)是由微軟研究人員於 2021 年提出的模型微調技術。它透過凍結預訓練模型的權重,並在架構中注入可訓練的降秩矩陣,能大幅減少所需的運算資源與可訓練參數數量。

來源

本期分類
相關主題