模型發布
Noiz AI 發布實時交互影音世界模型 HelixWorld 1.0,支援 24FPS 畫面與 48kHz 立體聲
量子位單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,Noiz AI 聯合香港科技大學、清華大學與 CMU 等機構研究員,發布實時可交互影音世界模型 HelixWorld 1.0。該模型支援 24 FPS 實時生成畫面與 48kHz 雙聲道音訊,採用原生 Transformer 架構,基於影音生成基座 LTX2.3 引入動作控制,使畫面與聲音從生成起即綁定,能跟隨用戶操作實時響應。
為實現實時持續生成,模型將雙向預訓練改造成因果模型,透過 KV Cache 逐塊自迴歸生成。在加速方面,結合軌跡蒸餾與 DMD(分布匹配蒸餾)技術,將去噪步數壓縮至個位數,以避免傳統 DMD 易導致畫面過曝失真的問題。訓練資料方面,團隊結合真實世界第一人稱連續行走素材與遊戲引擎資料,建立百萬量級訓練片段,確保聲畫空間與時間的幀級對齊。
HelixWorld 1.0 的 API 目前已在內測中,模型權重與程式碼預計於接下來幾週內在 GitHub 完全開源。
讀原始報導