模型發布
Qwen新TTS雙版本登場
X @Alibaba_Qwen
Qwen 發布 Qwen-Audio-3.0-TTS,分為主打即時互動的 Flash 與高品質生成的 Plus 版本。新模型支援 16 種語言,可透過行內標籤與自然語言控制耳語、憤怒、呼吸及笑聲等表現,並能從含雜訊的參考音訊產生乾淨輸出。模型可單次生成最長 3 分鐘內容,Qwen 並稱其已登上 Artificial Analysis TTS Leaderboard 第一名。
讀原始報導背景
Qwen3-TTS 是阿里雲 Qwen 團隊開發的開源語音合成模型系列,支援串流語音生成、自由語音設計與語音複製。Qwen-Audio-3.0-TTS 可透過自然語言指令控制角色、情緒、語速、音色、風格與口音,並以行內標籤精細調整句中表現;其中 Plus 側重高品質生成,Flash 則主打互動情境的低延遲。