模型發布
開發者以純 MLX 實作 Nemotron Omni 視覺與音訊模組,解決 Mac 多模態載入問題
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 社群分享,有開發者以純 MLX 框架實作了 Nvidia 開放權重模型 Nemotron Omni 的視覺與音訊模組,解決了標準 MLX 工具僅能載入其文字骨幹的問題。該專案將 c-radio vit-h 視覺模組、parakeet conformer 音訊模組、處理器及 token 拼接邏輯從 Nvidia 的 PyTorch 參考實作完整移植,語言模型採用 4-bit 量化,視覺與音訊模組則採 bf16 格式。
開發者表示,所有組件皆通過與 PyTorch 版本的對比測試(23 項全數通過),音訊模組每幀餘弦相似度達 0.99999130,視覺模組在 MLX CPU 串流上更達到 1.0 完全一致。在 M5 Max 晶片實測中,純文字推論速度為 152 tok/s,音訊處理為 147 tok/s,影像處理則為 67.7 tok/s。影像路徑的峰值記憶體佔用約 22.1GB,預期可在 32GB 記憶體的 Mac 上順利運行,專案目前已透過 MIT 授權於 GitHub 開源。
官方資料補充顯示,Nemotron Omni 系列(如 Nemotron 3 Nano Omni)曾在複雜文件智慧與影音理解等六項排行榜奪冠,其訓練資料集包含約 1,270 億個跨模態預訓練 token 及 1.24 億個微調範例。
讀原始報導背景
NVIDIA 的 Nemotron Omni 是一款開源的全模態推論模型,具備視覺、聽覺與推論能力。該模型專為真實世界的文件分析、多影像推理、語音辨識及長影音理解等任務所打造。