模型發布
120M 參數開源 TTS 模型 Sopro V2 發布:支援零樣本語音複製,M3 CPU 首包延遲約 300ms
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 社群消息,開發者發布了 120M 參數的開源語音合成模型 Sopro V2(具體版本為 sopro-v2-turbo),採 Apache-2.0 授權。該模型支援零樣本語音複製(Zero-shot voice cloning),僅需 5 至 20 秒的參考音訊即可生成語音。
Sopro V2 支援英文、法文、德文,並標榜為首個原生針對歐洲葡萄牙語(非巴西葡萄牙語)進行最佳化的開源 TTS 模型。效能方面對 CPU 友善,在 M3 CPU 上串流生成的首包延遲(Time-to-first-audio)約 300ms,RTF(即時率)為 0.21;在 H100 GPU 上 RTF 則可達 0.07。
在 Seed-TTS-eval 的 test-en 測試中,Sopro V2 的 WER(字錯率)達到 1.51-1.65,優於體積大 3 到 14 倍的競品模型,包含 F5-TTS(1.83)、CosyVoice 3(2.02)及 Spark-TTS(1.98)。使用者可透過 `uvx --from sopro soprotts serve` 單一指令在本地端下載模型並啟動 Web UI 介面。
讀原始報導背景
新聞中用於一鍵啟動的 `uvx` 指令,是 Python 套件管理工具 `uv` 的功能,能讓使用者在臨時環境中快速執行命令列工具。此外,文字轉語音(TTS)領域常以即時率(Real-Time Factor, RTF)與首字音訊延遲(Time-to-First-Audio, TTFA)作為衡量模型推論與串流效能的關鍵指標。
來源
相關主題