跳到主要內容
2026-08-29 日報
模型發布

Tontaube 發布 2.9B 開源 TTS 模型 TontaubeV1:首包延遲 200ms,支援長文本與零樣本語音複製

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群消息,Tontaube 開發團隊發布 2.9B 參數的開源權重 TTS 模型 TontaubeV1,專注於長文本生成與低延遲本地推論。該模型主要支援英文與德文,並允許使用最長一分鐘的參考音訊進行零樣本(zero-shot)語音複製。 架構上,TontaubeV1 採用四個獨立的自迴歸模型,從粗略語義結構逐步生成至聲學細節,較高層的碼本(codebooks)模型體積遞減。模型採用字元級文本標記化(tokenization),並透過滾動上下文視窗(rolling context window)實現串流與無限制的長文本生成。 效能方面,開發者稱在預熱的 RTX 5090 上,單一文本的 RTF(即時率)約 0.08;啟用批次處理後可低至 0.02(約 50 倍即時速度),串流模式下首包音訊延遲約 200ms。由於採用 vLLM 實作以支援高併發與低延遲,目前硬體門檻較高:低 VRAM 與均衡設定檔至少需 24GB VRAM,高吞吐量設定檔需 32GB VRAM。團隊計畫未來推出適用於較小 GPU 與終端裝置的量化版本,並支援微調。 在內部進行的 400 段文本 LLM-as-a-judge 有聲書評測中,TontaubeV1 的韻律表現與 ElevenLabs Flash v2.5 相當(勝率 50.1%),並優於 Fish Audio S2 Pro、Gradium 與 Cartesia Sonic 3。開發團隊表示,未來幾天將把模型提交至 TTS Arena V2 與 Artificial Analysis 進行人類盲測。
讀原始報導

背景

vLLM 是一個開源的模型推論與部署框架,最初由加州大學柏克萊分校開發。該框架以 PagedAttention 記憶體管理技術為核心,支援連續批次處理與量化等功能,能為開源模型提供高效能的推論能力。

來源

相關主題