跳到主要內容
2026-09-03 日報
模型發布

智源研究院與北大開源音訊-語言模型 GaussianMind,基於 RoboBrain 與 OpenMOSS Audio 開發

HF @BAAI一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

智源研究院(BAAI)與北京大學計算機學院唐浩團隊聯合研發的音訊-語言模型 GaussianMind 已在 Hugging Face 開源上架。該模型基於 RoboBrain 與 OpenMOSS Audio 開發而成。目前儲存庫包含自訂的 Transformers 程式碼,使用者在載入模型與處理器(AutoProcessor)時,需設定 `trust_remote_code=True`。
讀原始報導

背景

GaussianMind 是由北京大學與北京智源人工智能研究院(BAAI)共同研發的音訊語言模型。該模型建立在 RoboBrain 與 OpenMOSS Audio 的基礎上,其中 OpenMOSS Audio 為開源的音訊理解基礎模型,可處理語音、音樂及問答推理;RoboBrain 則涉及利用雲端運算與儲存資源的雲端機器人技術。

來源