MiniMax H3主打開源影片剪輯
據量子位報導,MiniMax 發布首個開源影片模型 MiniMax H3,主打文字、圖片、音訊與影片的全模態理解,以及端到端剪輯、特效、字幕與音畫協同。文章稱,H3 可生成最高 2K 影片,並具備可商用文字生成與較低推論價格,底層採用 H3-Omni Transformer。相關能力、評測排名與商用表現目前僅有單一來源描述,仍待更多佐證。
量子位
21 則值得知道的變化
據量子位報導,MiniMax 發布首個開源影片模型 MiniMax H3,主打文字、圖片、音訊與影片的全模態理解,以及端到端剪輯、特效、字幕與音畫協同。文章稱,H3 可生成最高 2K 影片,並具備可商用文字生成與較低推論價格,底層採用 H3-Omni Transformer。相關能力、評測排名與商用表現目前僅有單一來源描述,仍待更多佐證。
Google 的 Gemini Omni Flash 首次登上 Artificial Analysis Video Editing Leaderboard 榜首,並在 Text to Video 與 Image to Video 評測拿下第一,領先 Alibaba 的 Wan 2.7 與 HappyHorse 1.0。
字節跳動於7月31日發布影片生成模型 Seedance 2.5,已上線豆包、即夢、扣子與小雲雀,並將透過火山引擎向企業開放。模型單次可生成最長30秒影片,支援最多50個多模態參考素材、白模與綠幕參考,以及影片局部編輯和十多種語言。徐工集團、小鵬汽車等企業已展開合作,應用涵蓋工業培訓、產品設計、自動駕駛測試與具身智慧訓練資料生成。