模型發布
音樂生成模型 YuE2 發布:SongBench 評測超越 Suno v6,支援 48 kHz 立體聲輸出
Hacker News單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據報導,全新音樂生成模型 YuE2 發布,採用旋律與和弦符號規劃(symbolic planning)。在 WildSongBench 的 SongBench 評測中,YuE2(best-of-8 設定)獲得 6.9632 分,超越 Suno v5(6.8721)、Suno v6(6.5562)及 Suno v6 Wild(6.4195)。官方 Hugging Face 頁面補充顯示,YuE2 包含 YuE2-Vae 模型,可將聲學潛在特徵轉換為 48 kHz 的立體聲音樂。
團隊同步推出具備 6.32 億參數的音樂表徵模型 MERT2,分為 30 秒上下文的 MERT2-30s 與 300 秒全曲上下文的 MERT2-FS,在 15 項 MARBLE 基準測試中取得 14 項 SOTA(涵蓋標籤、調性、曲風與情緒辨識)。此外,單一轉錄模型 SheetSage2 可同時處理節拍、重拍、調性、和弦、結構與旋律等 6 項任務,並在 13 項基準指標中取得 10 項 SOTA。
模型主要使用 CC0 與 Tokenwave.AI 授權的合成資料訓練,MERT2、YuE2 與 SheetSage2 的訓練資料量分別達 70 萬、34.6 萬與 2.84 萬小時。
讀原始報導背景
YuE2 是由 multimodal-art-projection 開發的音樂生成模型,主打具備符號規劃(symbolic planning)、零樣本翻唱與代理式音樂編輯等功能。其架構中的 YuE2-Vae 模型,能將聲學潛在特徵轉換為 48 kHz 的立體聲音樂。
社群討論
社群對 YuE2 評價兩極,部分人讚賞它是少見支援樂譜與 ABC notation 的開源權重符號生成器,方便製作翻唱與變奏,有網友實測在 Mac M1 上 15 分鐘即可產出結果。然而,多數人批評其產出缺乏靈魂且流於俗套(雖比 Minimax Music 3 乾淨),主因是受限於 CC0 免版稅訓練資料,且人聲表現不如每月 24-30 美元的 Suno。核心分歧在於,反對者擔憂黑箱式生成會貶低人類創作意義,而支持者則期望 AI 能成為融入 DAW 的代理式輔助工具,保留創作者的品味與控制權。