跳到主要內容
2026-08-22 日報
模型發布

FireRedTeam 發布 9B 音訊模型 FireRedAudio 與 FireRedTTS3:支援一小時音訊理解與 24 國語言語音複製

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群消息,FireRedTeam 於 Hugging Face 釋出多用途音訊語言模型 FireRedAudio 與語音生成編輯系統 FireRedTTS3。 FireRedAudio 基於 9B 參數的語言模型打造,採用解耦連續表徵(decoupled continuous representations)設計:由 Audio Encoder 負責理解,RedAE 負責生成,兩者共用相同的語言與推理骨幹。該模型支援自動語音辨識(ASR)、零樣本(zero-shot)與指令 TTS,並能處理長達一小時的錄音,提供精確的時間對齊與摘要檢索功能。 同步推出的 FireRedTTS3 分為 Base 與 Instruct 雙版本。Base 版支援 24 種語言與 21 種中文方言的零樣本語音複製,據稱在 MiniMax-MLS-Test 評測中取得平均 3.754% 的字錯率(WER/CER)與 84.8% 的說話者相似度;Instruct 版則支援透過自然語言描述設計聲音,並可進行語意(插入、刪除、替換)與聲學(語速、音高、音量)的自由格式語音編輯。
讀原始報導