跳到主要內容
2026-09-03 日報
模型發布

LLaDA-Image 發布 6B 參數圖像生成與編輯模型,開源完整訓練配方並創 Qwen-Image-Bench 開源新高

HF Daily Papers一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

研究團隊發布 LLaDA-Image,這是一個 6B 參數的擴散 Transformer (DiT) 圖像生成與編輯模型,並全面開源模型權重、訓練程式碼與詳細配方。該架構結合從頭訓練的 DiT 與基於 LLaDA2.0-Mini 骨幹的凍結視覺語言理解模組。在訓練策略上,模型初期不依賴成對的圖文資料,而是透過 2.2 億個樣本(含 9800 萬真實圖像)進行純圖像預訓練以建立強大的視覺先驗,並在 DiT 中全面使用無參數 RMSNorm 與 Muon 最佳化器。 LLaDA-Image 支援實用的文生圖、VQ 條件生成、參考圖像編輯及中英文文字渲染。除了 50 步的高品質基礎版本,團隊亦釋出經蒸餾的 LLaDA-Image-Turbo,可於 2 至 4 步內完成快速推論。在 Qwen-Image-Bench 評測中,LLaDA-Image 在英文與中文賽道分別取得 53.53 與 53.38 分,創下開源模型的新 SOTA。
讀原始報導

背景

Diffusion Transformer (DiT) 是一種結合擴散模型與 Transformer 架構的影像生成技術,於 2022 年底首度提出。而 Muon 則是 2024 年底推出的新型最佳化器(optimizer),專門用於神經網路的隱藏層權重,透過牛頓-舒爾茨(Newton-Schulz)迭代法來提升訓練速度與效能。

來源