模型發布
Inflect-Micro-v2 發布
Hacker News
Inflect-Micro-v2 是一款可在本機部署的英文 TTS 模型,以 9,356,513 個參數提供 24 kHz 單聲道語音,支援 CPU 或 CUDA 推論。模型 FP32 權重為 37.53 MB,四執行緒 CPU 測試達到即時速度的 6.28 倍,並提供公開適配工具,可訓練固定聲線或語言及匯出 PyTorch、ONNX 套件。目前僅支援固定英文聲線,適配後的品質仍屬實驗性質,會受資料集、前端與流暢度評估影響。
讀原始報導背景
Inflect-Micro-v2 是獨立開發者 Owen Song 推出的固定聲線英文 TTS 模型,可在本機將文字合成 24 kHz 單聲道音訊,並支援 CPU 或 CUDA 推論,執行時不需參考語音。模型約有 936 萬個參數,完整 FP32 權重為 37.53 MB,小到可隨桌面或行動應用程式一同部署。
社群討論
整體高度肯定 9.36M 參數就能完成本機 text-to-waveform TTS,認為其尺寸與音質表現令人驚豔,甚至已有 speech dispatcher、伺服器及瀏覽器實作。討論也特別釐清它僅支援英文固定男聲,不含 STT、zero-shot voice cloning,且有人批評語調怪、聽感僅約歷史 TTS 水準,另有人反駁其明顯優於十年前的工具。實測補充指出網頁版在 iPhone 13/14 Pro 播放 2~3 次後會當掉,開發者已確認有 memory leak。