模型發布
NVIDIA 語音模型堆疊支援本地端執行,ASR、TTS 與 Codec 量化為 GGUF 格式並整合至 NeMo-Speech.cpp
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據社群報導,NVIDIA 的語音模型堆疊(包含 ASR、TTS 與 Codec)已量化為 GGUF 格式,可透過 NeMo-Speech.cpp 在本地端裝置執行。支援的模型陣容涵蓋 Magpie-TTS Multilingual、Nemotron Speech Streaming EN 0.6B、Parakeet CTC 1.1B、Parakeet TDT 0.6B v3 以及 NanoCodec。此外,官方 Hugging Face 頁面顯示,NVIDIA 已正式為 nemotron-3.5-asr-streaming-0.6b 模型新增 Q8_0 量化版本的 GGUF 格式,以支援 NeMo-Speech.cpp 的本機推論。
讀原始報導背景
GGUF(GGML Universal File)是由 llama.cpp 專案於 2023 年 8 月推出的二進位檔案格式,專為快速儲存與載入模型資料而設計。NVIDIA 的 NeMo Speech 則是一個具備擴充性的生成式 AI 框架,可搭配 Python、PyTorch 與 CUDA 運作。