模型發布
NVIDIA 推出開源多語音 TTS 模型 Magpie,支援 12 語言且 B200 首包延遲僅 32ms
HuggingFace Blog一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

NVIDIA 推出開源權重的多語音文字轉語音(TTS)模型 Magpie,官方部落格稱其具備 3.64 億參數,而 Hugging Face 專案儲存庫則標示為 357M。
該版本支援 12 種語言,包含新加入的現代標準阿拉伯語、韓語及巴西葡萄牙語,並透過 IPA 字母到音素處理與自訂發音字典,強化印地語及日語的語碼轉換(code-switching)能力。
架構上導入幀堆疊(Frame stacking)技術,每次解碼步驟預測兩個音訊幀以將迭代次數減半,並搭配局部 Transformer(Local transformer)修正同步生成帶來的品質減損。
效能方面,透過 NVIDIA NIM 部署於本地端,B200 GPU 的單串流首包音訊延遲(TTFA)為 32ms,64 串流併發下 TTFA 為 239ms,吞吐量達即時播放的 319.81 倍;H100 與 A100 單串流 TTFA 則分別為 47ms 與 79ms。
讀原始報導背景
NVIDIA NIM 提供預先建置且經過最佳化的推論微服務,能將最新的 AI 模型快速部署至雲端、資料中心、工作站與邊緣設備等基礎架構。Magpie TTS 即是支援此微服務的開源權重語音生成模型,讓開發者能完全掌控部署環境並針對特定領域進行微調。