NVIDIA 發布 15B 無編碼器多模態模型 PixelUMM,支援像素級圖文影理解與生成
該模型以 Qwen3-8B 為語言骨幹,捨棄獨立視覺編碼器,直接將影像轉為 16x16 像素區塊處理,權重僅限非商業研究使用。
HF @nvidia一手來源
58 則值得知道的變化
該模型以 Qwen3-8B 為語言骨幹,捨棄獨立視覺編碼器,直接將影像轉為 16x16 像素區塊處理,權重僅限非商業研究使用。
新轉錄模型支援 60 種語言自動偵測,詞錯誤率僅 2.50%,並同步推出具備受限語音複製功能的 MAI-Voice-2.1。
新版將檔案支援上限提升至 10 MiB,並提供每月各 1000 次語義與全文檢索免費額度,計費僅涵蓋攝取、儲存與查詢。