跳到主要內容
2026-09-24 日報
模型發布

據報導阿里發布 Qwen-Audio-3.1 五款語音模型,API 價格最高調降 95%

The Decoder單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,阿里的 Qwen 團隊發布 Qwen-Audio-3.1 系列,包含五款針對語音辨識(ASR)、文字轉語音(TTS)及即時互動的模型,並大幅調降 API 價格。ASR 模型提升了多語種與方言辨識能力,可自動清除冗詞與重複片段;進階的 ASR-Next 增加帶有時間戳記的多語者辨識,並能偵測情緒、環境音與機器噪音。TTS 模型支援多語種合成與自然跨語言聲音轉換,允許透過文字提示控制情緒、語速與風格;TTS-Next 則結合語言模型與 diffusion 方法,可一次性生成語音、音效與背景音。即時互動模型支援同時說與聽及即時打斷,官方稱其能感知情緒,例如在偵測到低落情緒時會以較慢且更具同理心的方式回應。在定價方面,ASR 價格最高調降 95%,即時模型調降約 85%,TTS 則調降約 70%。
讀原始報導

背景

Qwen-Audio 是基礎的多任務音訊語言模型,旨在透過統一的大型模型實現通用的音訊理解,並支援多種任務、語言與音訊類型。此次更新中 TTS-Next 所使用的擴散模型(Diffusion model)是一種生成式模型,其原理是透過學習反轉添加雜訊的過程,從而生成所需的資料樣本。

來源