模型發布
NVIDIA 發布 NeMo Speech 3.0,代碼庫獨立專注語音領域並推出 Nemotron-3.5-ASR 等多款新模型
GitHub Trending (python)單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
NVIDIA 發布 NeMo Speech 3.0(v3.0.0)與 26.07.00 NGC 容器。該代碼庫自 2026 年起已進行拆分,目前專注於音訊、語音與多模態 LLM(拆分前支援其他模態的最終版本為 v2.7.3)。
官方同步釋出多款新語音模型:2026 年 7 月推出 MagpieTTS v2607,新增阿拉伯文、韓文與葡萄牙文,總支援語言達 12 種;6 月推出 Nemotron-3.5-ASR-Streaming-0.6B,基於快取感知 Fastconformer 架構,支援 40 種語言,具備 80ms 至 1s 的可控延遲,單張 H100 可支援 240 至 2400 個併發串流。
此外,4 月發布的 Parakeet-unified-en-0.6b 將高品質離線與串流推論(最低延遲 160ms)整合於單一英文模型,並支援標點與大小寫;3 月釋出基於 Nemotron Nano v2 LLM 骨幹的 Nemotron 3 VoiceChat 搶先體驗版,提供全雙工、可打斷的低延遲自然對話,並更新 Nemotron-Speech-Streaming v2603 以降低所有延遲模式下的字錯率(WER)。
NeMo Speech 3.0 支援 Python 3.12 與 PyTorch 2.7 以上版本,官方推薦使用 uv 從原始碼安裝,其主動測試與支援的環境為 Python 3.13 搭配 PyTorch 2.11/CUDA 12.9 或 PyTorch 2.12/CUDA 13.2。官方特別提醒,自 PyTorch 2.6 起 torch.load 預設啟用 weights_only=True,載入部分模型權重時可能需要設定環境變數 TORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1,但強烈建議僅對受信任的檔案執行此操作,以避免任意程式碼執行風險。
讀原始報導背景
NVIDIA NeMo 是一個專為研究人員與開發者打造的可擴展生成式 AI 框架,涵蓋大型語言模型、多模態與語音 AI(如自動語音辨識與文字轉語音)等領域。該框架整合了 NVIDIA 開發的 Nemotron 系列模型,支援推理、程式編寫與代理 AI 等應用,並提供開源的模型權重與訓練方法。