跳到主要內容
2026-08-14 日報
模型發布

Zero-Shot 語音生成模型 IndexTTS 發布 2.5 版:支援 5 種語言、升級音素與語速控制,並支援 vLLM 部署

GitHub Trending (python)單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

開源 Zero-Shot 文字轉語音系統 IndexTTS 發布 2.5 版本,該系統主打僅需單一參考音訊即可複製聲音。新版擴展支援中文、英文、日文、西班牙文與阿拉伯文等 5 種語言,推論速度較前代 IndexTTS-2 更快,並保留了跨語言與音色-情感解耦(timbre-emotion disentanglement)能力。 在控制性方面,IndexTTS-2.5 提升了對中文拼音、英文 CMU 音素與日文假名的發音控制精度,並新增 `duration_factor` 參數,允許使用者在 0.5 倍至 2.0 倍之間調整語速。 針對生產環境,新版正式支援透過 vLLM 進行部署。在推論最佳化上,IndexTTS-2.5 支援 BF16 半精度推論以降低 VRAM 佔用,並可搭配 DeepSpeed 進行加速。
讀原始報導

背景

vLLM 是源自加州大學柏克萊分校的高效能開源推論引擎,專注於提升大型語言模型的記憶體管理與吞吐量。CMUdict 則是由卡內基美隆大學開發的開源英語發音字典,廣泛應用於語音相關技術研究。

來源

相關主題