模型發布
NVIDIA 開放 100M 參數語者辨識模型 Nemotron 3 Diarization,支援即時分辨最多 8 名講者
The Decoder單一來源
核實資料不足
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
本次未取得足夠原文證據

據報導,NVIDIA 發布具備約 1 億參數的 AI 模型 Nemotron 3 Diarization,並免費開放權重。該模型支援錄音與即時音訊,最多可分辨 8 名講者並偵測重疊語音,但過多參與者、背景噪音或殘響會增加錯誤率。若搭配 Parakeet 等語音辨識系統,可生成帶有「speaker_2」等匿名標籤的逐字稿。
模型音訊緩衝區提供 30.4 秒至 0.32 秒共四個等級,緩衝越短準確率通常越低。在 VoiceArena 的 Diarization-Bench 嚴格基準測試中(計入重疊語音與微小對齊誤差),該模型以 14.72% 的錯誤率位居第一,優於第二名的 19.3%。與前代 Streaming Sortformer 相比,在使用 1.04 秒緩衝區的八個測試場景中,新模型平均降低了 41% 的錯誤率。
讀原始報導背景
Speaker diarization 模型旨在判斷真實世界音訊中「誰在什麼時候說話」,並可支援串流與離線推論。新聞中提及可搭配使用的 Parakeet,則是 Nvidia 推出的一款具備 6 億參數的自動語音辨識(ASR)模型,專為高品質的英語逐字稿所設計。