跳到主要內容
2026-07-29 日報
模型發布

Qwen Audio 3.0評測登頂

X @ArtificialAnlys
Alibaba 推出原生語音到語音模型 Qwen Audio 3.0 Realtime,提供 Plus 與 Flash 版本。Plus 在 Artificial Analysis Speech to Speech Index 以 84.1% 居首,並領先三項組成評測,Flash 則以 76.3% 排名第四。值得注意的是,Plus 首次輸出音訊平均需 4.02 秒,速度屬榜上較慢者;每小時輸入音訊成本為 4.42 美元。
讀原始報導

背景

Artificial Analysis 的 Speech to Speech Index 用單一分數衡量原生語音對語音模型,綜合語音推理、對話動態與代理任務表現,分數越高代表整體表現越好。阿里巴巴亦推出 Qwen-Audio-3.0-TTS,提供主打即時互動的 Flash 與高品質生成的 Plus 版本,支援 16 種語言及以自然語言控制語音風格。

來源