LLaDA-Image 發布 6B 參數圖像生成與編輯模型,開源完整訓練配方並創 Qwen-Image-Bench 開源新高
該 6B 模型採用 Muon 最佳化器進行純圖像預訓練,Turbo 變體僅需 2-4 步推論,並支援中英文文字渲染與指令引導編輯。
HF Daily Papers一手來源
30 則值得知道的變化
該 6B 模型採用 Muon 最佳化器進行純圖像預訓練,Turbo 變體僅需 2-4 步推論,並支援中英文文字渲染與指令引導編輯。
該模型由北大唐浩團隊與智源研究院共同研發,已上架 Hugging Face,需透過自訂 Transformers 程式碼載入。
該模型參數達 44 億,基於 Qwen3-VL-4B 微調,採 Apache-2.0 授權,可提升度量距離與相對位置等空間關係的視覺推理能力。