NVIDIA 發布 15B 無編碼器多模態模型 PixelUMM,支援像素級圖文影理解與生成
該模型以 Qwen3-8B 為語言骨幹,捨棄獨立視覺編碼器,直接將影像轉為 16x16 像素區塊處理,權重僅限非商業研究使用。
HF @nvidia一手來源
58 則值得知道的變化
該模型以 Qwen3-8B 為語言骨幹,捨棄獨立視覺編碼器,直接將影像轉為 16x16 像素區塊處理,權重僅限非商業研究使用。
大規模消融實驗顯示,在相同時間預算與 LLM 骨幹下,最先進的複雜框架與僅具備基礎讀寫權限的單一代理表現無異,底層模型能力才是效能關鍵。
該方法讓模型在失敗後寫下 TL;DR 洞察並進行反向傳播,僅需 4 千筆任務與洞察配對資料進行訓練,即可達到完整訓練效能。
Ataraxos 克服龐大隱藏資訊與單局高達兩千步的挑戰,以 15 勝 1 敗戰績,擊敗稱霸世界第一逾 600 週的人類玩家。
測試 8 款模型發現,當錯誤答案被包裝成檢索來源時,多數模型會放棄原先正確答案,僅 Gemini-3.1-Pro 幾乎不受影響。
該架構將上下文視為檔案供模型自主更新,結合線上強化學習讓 Qwen3.5-9B 效能提升 47.6%,並降低 35% 伺服器運算成本。
該研究以廣義教師強制(GTF)穩定 DEER 演算法,支援百萬級長度序列,在動態系統重建任務上效能超越 Mamba。