跳到主要內容
2026-09-18 日報
模型發布

階躍星辰發布 StepAudio 3 語音大模型系列:涵蓋即時互動、ASR、TTS 與音樂生成

AI 前線單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,階躍星辰於 9 月 15 日發布新一代語音大模型 StepAudio 3 系列,推出 Realtime、ASR、TTS、Gen 與 Music 五款模型,目前均已上線其開放平台。 StepAudio 3 Realtime 專注於即時語音互動,支援原生全雙工對話與臨時打斷。該模型結合語音推理與任務執行能力,支援非同步執行 Tool Call 與長任務而不打斷當前對話。在 Artificial Analysis 的 Conversational Dynamics(綜合得分 98.9%)與 Speech Reasoning 榜單中均排名全球第一。 StepAudio 3 ASR 結合大語言模型上下文理解,支援中英混說與方言,在 Artificial Analysis 非串流語音辨識榜單中以 1.7% 的詞錯誤率(WER)並列第一。StepAudio 3 TTS 採用串流生成架構,除音色與語調外,還能生成笑聲、遲疑、改口等真實交流的副語言表現。 StepAudio 3 Gen 可透過自然語言描述,一次生成包含人聲、音效與背景音樂的完整音訊,並控制聲音出現的時間與順序。StepAudio 3 Music 則支援清唱配樂、翻唱以及基於 ABC 記譜法的多輪互動編曲創作。
讀原始報導

背景

階躍星辰成立於 2023 年 4 月,由前微軟全球副總裁姜大昕創立。該公司總部位於上海,主要專注於大型語言模型及多模態模型的研發。

來源