NVIDIA 開放 100M 參數語者辨識模型 Nemotron 3 Diarization,支援即時分辨最多 8 名講者
該模型權重免費開放,能處理重疊語音與即時音訊,在 VoiceArena 基準測試以 14.72% 錯誤率奪冠,較前代降低 41%。
The Decoder單一來源
39 則值得知道的變化
該模型權重免費開放,能處理重疊語音與即時音訊,在 VoiceArena 基準測試以 14.72% 錯誤率奪冠,較前代降低 41%。
該引擎將 99 GiB 模型權重存放於 SSD,透過預取技術與 NVFP4 矩陣乘法加速,效能為同機 llama.cpp 兩倍,目前僅限 RTX 50 系列顯卡。