模型發布
Kyutai 開源輕量級語音生成模型 pocket-tts:僅 100M 參數,專為 CPU 最佳化且首包延遲 200ms
GitHub Trending (python)單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
Kyutai 推出輕量級文字轉語音 (TTS) 模型 pocket-tts,專為在 CPU 上高效運行而設計,讓開發者無需依賴 GPU 或 Web API 即可生成語音。該模型參數僅 1 億 (100M),支援音訊串流,首包延遲 (first audio chunk) 約為 200ms。
在效能方面,pocket-tts 僅需使用 2 個 CPU 核心,在 MacBook Air M4 的 CPU 上生成速度約為即時的 6 倍。官方指出,由於模型極小且 batch size 為 1,實測在 GPU 上執行並未觀察到加速效果。
功能上,該模型支援無限長文字輸入與語音複製 (Voice cloning),使用者可直接輸入 wav 檔作為聲音提示,或將其轉換為 safetensors 格式以大幅加快載入速度。目前支援英、法、德、葡、義、西等六種語言;針對非英語語言,官方額外提供較大的 24 層變體,以犧牲部分速度換取更高的語音品質。
pocket-tts 支援 Python 3.10 至 3.14,並要求 PyTorch 2.5 以上版本(不需 GPU 版)。官方提供 Python API、CLI 工具以及本地 HTTP 伺服器供開發者部署,同時因模型體積小巧,社群已開發出基於 WebAssembly/JavaScript 的實作,使其能在瀏覽器端直接執行。
讀原始報導