模型發布
Cartesia 推出 Sonic 3.6 TTS 模型,登頂 Artificial Analysis 語音雙榜首,生成速度達 136.1 cps
X @ArtificialAnlys單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
Cartesia 推出最新 TTS 模型 Sonic 3.6,在 Artificial Analysis 的 Provider Voice 與 Controlled Voice 兩個語音評測榜單中均奪得第一。該模型支援英、日、法、德等 40 多種語言,並在對話中展現出自然的語音與自適應語速。
在 Controlled Voice 榜單中,Sonic 3.6 以 1,144 的 Elo 積分位居榜首,超越自家前代 Sonic 3.5(1,099 分)與 ElevenLabs 的 Eleven v3(1,060 分)。在 Provider Voice 榜單中,Sonic 3.6 獲得 1,286 分,擊敗 Speechify AI 的 Simba 3.2(1,238 分)與阿里的 Qwen-Audio-3.0-TTS-Plus(1,237 分)。
生成速度方面,Sonic 3.6 達每秒 136.1 字元(cps),大幅領先 Eleven v3(46.7 cps)與 Google Gemini 3.1 Flash TTS(24.2 cps)。
定價部分,Sonic 3.6 透過 Cartesia 平台提供,每百萬字元收費 49 美元。在排名前三的模型中價格最高,約為 Simba 3.2(10 美元)的 5 倍、Qwen-Audio-3.0-TTS-Plus(27.59 美元)的近 2 倍,但仍只有 Eleven v3(100 美元)的一半。
讀原始報導背景
Artificial Analysis Speech Arena 是一個託管於 Hugging Face 的文字轉語音(TTS)系統排行榜,讓使用者能比較不同技術的表現。Cartesia 推出的最新 TTS 模型 Sonic 3.6 支援超過 40 種語言,在該排行榜的對話測試中展現了自然的語音與適應性語速。