跳到主要內容
2026-08-13 日報
模型發布

開源語音模型 IndexTTS 2.5 發布:推論加速 2.28 倍,支援中英日等五語零樣本情感轉移

X @Xianbao_QIAN單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據開發團隊於社群平台發布的消息,開源文字轉語音(TTS)基礎模型 IndexTTS 2.5 正式推出,主打多語言覆蓋、新語言的零樣本(Zero-shot)情感轉移,以及 2.28 倍的推論速度提升。該版本透過四項關鍵技術進行升級:首先是語義編解碼器壓縮,將幀率從 50 Hz 降至 25 Hz,使序列長度減半,大幅降低訓練與推論成本。其次在架構上,將 Semantic-to-Mel(S2M)模組的 U-DiT 骨幹替換為更高效的 Zipformer 架構,減少參數量的同時加快梅爾頻譜圖(mel-spectrogram)生成速度。第三是多語言擴展,透過邊界感知對齊、Token 級別拼接與指令引導生成等跨語言建模策略,在無需目標語言情感訓練資料的情況下,實現支援中文、英文、日文、西班牙文與阿拉伯文的零樣本情感轉移。最後,團隊在 Text-to-Semantic(T2S)模組的後訓練階段導入群組相對策略最佳化(GRPO)強化學習,以提升發音準確度與自然度。官方已釋出演示頁面,並支援透過 vLLM 進行推論部署;其展示的評測對象包含 CosyVoice 3、Fish Audio S2 Pro 等多款開源語音模型。
讀原始報導

背景

IndexTTS 2.5 採用的 Zipformer 架構,是一種原先應用於自動語音辨識(ASR)的高效能編碼器。此外,該模型支援透過 vLLM 進行推論,vLLM 是發源於加州大學柏克萊分校的開源推論引擎,專為大型語言模型提供高吞吐量與高效率的記憶體管理。

來源