阿里 Wan 3.0 影片生成模型公測:單次生成達 30 秒,首度支援 PPT 等文件輸入
模型強化了角色與風格的一致性,並支援指定時間區間的局部畫面修改,API 將於近期全量開放,720P 定價每秒 0.6 元。
愛範兒單一來源
71 則值得知道的變化
模型強化了角色與風格的一致性,並支援指定時間區間的局部畫面修改,API 將於近期全量開放,720P 定價每秒 0.6 元。
華為入選論文著重算力最佳化,包含降低 79% 記憶體占用的 RaMod 框架;螞蟻集團則發表 MSRGC-Net,聚焦動態環境適應。
使用者可透過文字、圖片、影片及音訊等多種參考素材進行引導,在 Luma 單一工作流程中直接控制影片視覺與動態。
專案解決標準 MLX 僅能載入文字骨幹的限制,M5 Max 實測純文字推論達 152 tok/s,峰值記憶體 22.1GB。
包含 Magpie-TTS 與 Parakeet 等模型已可於本地運行,官方亦為 Nemotron-3.5 ASR 釋出 Q8_0 量化版本支援推論。