模型發布
SNU 研究員發布 1B 音訊語言模型 Sori-1B,無純文本預訓練、僅用 3 張 RTX 4090 訓練完成
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 社群消息,一名 SNU 研究員開發了 1B 參數的音訊語言模型 Sori-1B。其核心特點是解碼器完全基於音訊與文本配對資料從頭訓練,無純文本預訓練或預訓練語言模型初始化。此設計旨在讓模型回答真正基於音訊,而非依賴純文本先驗知識;作為對比,典型的 AF3 模型在音訊替換為靜音時,仍能保留約 74% 的 MMAU 領先幅度。
架構上,Sori-1B 直接沿用 NVIDIA 凍結的 Audio Flamingo Next 編碼器(佔總參數 61.5%),而解碼器、嵌入層、輸出層,以及一個基於音訊概念而非文本詞彙建構的自訂「聽覺本體(auditory-ontology)」分詞器,皆為從頭訓練。訓練過程僅使用 3 張 RTX 4090 顯示卡,資料量約為 7400 小時(475 萬個樣本)。
該模型支援選擇題、開放式問答、字幕生成與 ASR 模式,並內建推論端點處理程式、合成音訊終端機展示及 MMAU 測試腳本。由於重新分發 NVIDIA 編碼器受其 OneWay 條款限制,Sori-1B 權重僅限非商業與學術授權,目前開源庫狀態標示為「即將推出」。
讀原始報導背景
Audio Flamingo 是由 NVIDIA 開發的音訊語言模型,其最新的第三代版本基於 7B 語言模型與 LLaVA 架構所打造。而 MMAU 則是一項專注於大規模多任務音訊理解與推理的基準測試,強調模型在特定領域知識中的進階感知與推理能力。