跳到主要內容
2026-09-02 日報
模型發布

DreamX-Creator 1.0 發布:7B 原生音訊與影片聯合生成模型,支援 2K 解析度輸出

HF Daily Papers一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Jiashu Zhu 等 10 位作者共同發表 DreamX-Creator 1.0,這是一個 7B 參數的原生音訊與影片聯合生成系統。為解決過去影片生成模型忽略音訊或分階段合成的限制,該模型可根據首幀圖像與文字提示,同步對音訊與影片串流進行去噪。 在架構上,網路前半部獨立處理音訊與影片串流,後半部則透過門控跨模態注意力機制(Gated Cross-Modal Attention)進行耦合。訓練過程包含兩階段預訓練與高品質微調的漸進式聯合訓練,並引入音視強化學習,透過模態感知多模態回饋機制將回饋路由至對應串流。 針對高解析度輸出,團隊設計自迴歸單步 2K 優化管線(Autoregressive 1-Step 2K Refinement),將雙向多步教師模型蒸餾為每個時間區塊僅需一次去噪評估的學生模型。研究團隊表示,將釋出 7B 生成器與 2K Refiner 模型權重。
讀原始報導

背景

傳統的影片生成模型通常會忽略音訊或將其分開合成,限制了視覺動態與聲音事件的交互建模。跨模態注意力(Crossmodal attention)則是一種將注意力分配到不同感官(如視覺與聽覺)的機制,能讓系統同時處理多個感官模態的資訊。

來源