模型發布
NVIDIA 發布 15B 無編碼器多模態模型 PixelUMM,支援像素級圖文影理解與生成
HF @nvidia一手來源
已查原文 · 2 項主張
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
根據 Hugging Face 上的 PixelUMM 官方頁面,報導內容皆獲得證實。該模型確為 NVIDIA 發布之參數 15B、採用 Decoder-only 與 Qwen3-8B 架構的無編碼器多模態模型,透過 16x16 像素區塊處理影像。模型支援多種理解與生成任務,具備迭代去噪技術,其硬體環境要求相符,且模型權重明確受限於非商業用途。
NVIDIA 發布 15B 參數無編碼器多模態模型 PixelUMM,採 Decoder-only 及 Qwen3-8B 架構,將影像切為 16x16 區塊。
原文明確指出該模型為無編碼器、參數 15B,採用 Decoder-only Transformer 與 Qwen3-8B 語言骨幹,並將影像轉換為 16x16 像素區塊輸入。
encoder-free unified multimodal model
查看原始出處
Parameters: 15,199,672,064.
查看原始出處
Decoder-only Transformer
查看原始出處
Qwen/Qwen3-8B
查看原始出處
16-by-16 pixel patches.
查看原始出處
NVIDIA 在 Hugging Face 上架全新無編碼器(Encoder-Free)統一多模態模型 PixelUMM,參數規模約 15B。
該模型採用純解碼器(Decoder-only)Transformer 架構,並以 Qwen3-8B 作為語言骨幹。有別於依賴獨立預訓練視覺編碼器的傳統設計,PixelUMM 直接在像素空間中運作,將 RGB 影像分割為 16x16 的像素區塊(pixel patches)作為嵌入輸入,讓理解與生成任務共享同一套表示法,並透過迭代去噪(iterative denoising)技術進行生成。
PixelUMM 支援文字生成圖像、基於圖像的文字生成、影片理解以及影片生成。運行環境要求 Linux 系統、NVIDIA GPU,並需安裝支援 CUDA 的 PyTorch 與 FlashAttention。
授權方面,PixelUMM 的原始碼採 Apache 2.0 授權,但模型權重受 NVIDIA 單向非商業授權限制,僅供非商業研究或評估使用,尚未針對生產環境或高風險應用進行驗證。
讀原始報導背景
PixelUMM 的語言骨幹採用由阿里雲開發的 Qwen(通義千問)系列模型。該模型基於 Transformer 架構,這是一種運用多頭注意力機制的類神經網路,能將文字或影像等輸入資料轉換為 token 進行處理。