跳到主要內容
2026-08-14 日報
模型發布

MiniMax 釋出開源音樂模型 MiniMax-Music3,支援生成 5 分鐘完整歌曲

X @MiniMax_AI綜合 4 家報導多家報導
尚未逐項核實

多個報導來源提及此事;未必是彼此獨立的證據。

MiniMax 正式釋出新一代開源音樂生成模型 MiniMax-Music3,模型權重已上架 Hugging Face。該模型支援生成長達 5 分鐘的完整歌曲,輸出格式為 32 kHz、16-bit 立體聲 WAV 音訊。架構上採用 Hybrid-LM 設計,結合基於 Qwen3-8B 初始化的 8B Global LLM(負責長篇幅音樂結構與語意)以及 0.6B Local LLM(負責幀級別聲學細節),並搭配基於 Flow Matching 與 Flow-VAE 的合成系統。在控制方面,模型接受歌詞與詳細音樂描述作為雙重輸入,支援透過標籤定義歌曲結構(如前奏、主歌、副歌、橋段等),並可精細控制曲風、人聲特徵與編曲配置。目前 MiniMax-Music3 已可透過 ComfyUI 在本地端執行(相關 PR 已合併,檔案可於 Comfy-Org 取得),Diffusers 的支援 PR 也已提交。官方表示未來將推出雲端版本,並承諾在 AGI 到來前持續保持開源。
讀原始報導

背景

MiniMax Music 3 的底層合成系統採用了 Flow Matching 與 Flow-VAE 技術。Flow Matching 是一種生成模型技術,能學習將簡單的機率分佈(如高斯雜訊)轉換為複雜的資料分佈;而 Flow-VAE 則是結合標準化流(normalizing flows)的變分自編碼器,藉此豐富近似後驗分佈的表現能力。

來源