MiniMax 釋出開源音樂模型 MiniMax-Music3,支援生成 5 分鐘完整歌曲
結合 8B 全局與 0.6B 局部雙 LLM 架構及 Flow Matching 技術,允許透過歌詞標籤與結構化提示精確控制曲風與人聲。
X @MiniMax_AI綜合 4 家多家報導
67 則值得知道的變化
結合 8B 全局與 0.6B 局部雙 LLM 架構及 Flow Matching 技術,允許透過歌詞標籤與結構化提示精確控制曲風與人聲。
新版本驅動其 Document AI 堆疊,提供結構化區塊標籤與區塊級信心分數,標註頁面定價為每千頁 4.38 歐元。
H3 支援以文字指令直接修改影片畫面與對白,目前已於 Hugging Face 釋出兩個特定任務權重,並在影片編輯評測榜單登頂。
新版本推論速度超越前代,保留跨語言與音色情感解耦能力,提供 0.5 至 2 倍語速調整,並可透過 BF16 降低 VRAM 佔用。
據社群報導,該模型採 Apache 2.0 授權並經 5000 萬筆資料訓練,能以自然語言指令直接輸出分割遮罩與深度圖,但完整運行需 80GB 顯示記憶體。
定位為 dots3 家族中最輕量的開放權重模型,總參數 280B 且每次推論僅啟動 16B,能理解圖文影音並支援工具呼叫。