阿里發布 7B 圖文生成與編輯模型 Qwen-Image-2.1,原生支援透明圖與最多 10 張參考圖
已查原文 · 7 項主張
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
經查閱 Hugging Face 官方頁面、The Decoder 及 IT之家的報導,待查文章中的主張均獲證實。Qwen-Image-2.1 確為視覺部分僅有 7B 參數、採 32 層 Single-Stream DiT 架構的整合型模型,具備原生透明圖層生成、支援最多 10 張參考圖與局部標記編輯等能力。關於採用 KV cache 重用架構、可在 RTX 3090 消費級 GPU 運行且效能宣稱尚待獨立驗證等細節也符合來源。此外,提示詞模型 Qwen-Image-2.1-PE-T2I 具備 `<think>` 推理與 JSON 輸出功能,且全系列以 Qwen Research License Agreement 授權等資訊皆準確無誤。
阿里發布 Qwen-Image-2.1,整合文生圖與圖像編輯,視覺生成採 32 層 Single-Stream DiT 架構,參數 7B。
來源證實 Qwen-Image-2.1 是整合文生圖與圖像編輯的模型,且視覺生成部分擁有 7B 參數與 32層 Single-Stream DiT 架構。
将文生图与图像编辑整合
查看原始出處
仅有 7B 参数
查看原始出處
32 Single-Stream DiT layers
查看原始出處
編輯支援最多 10 張參考圖,可透過圓圈、遮罩或塗鴉標記指定局部編輯。
官方與報導皆提及支援最多 10 張參考圖,並允許使用者藉由圓圈、遮罩或塗鴉等標記進行局部編輯。
支持最多 10 张参考图
查看原始出處
circles, masks, or painted marks
查看原始出處
架構採用混合粒度注意力與前綴 KV cache 重用,以降低成本並加速推論。
文件提到模型架構採混合粒度注意力與 KV cache 重用機制,以提升推理效率。
mixed-granularity attention
查看原始出處
KV cache reuse
查看原始出處
官方稱效能超越多數閉源模型,可於 RTX 3090 等消費級 GPU 上運行,但尚待獨立基準測試驗證。
報導指出 Qwen 自稱效能優於多數閉源模型並可在 3090 上運行,但也強調這需要獨立基準測試來證實。
beats most closed models
查看原始出處
independent benchmarks are still pending
查看原始出處
GPUs like a 3090
查看原始出處
同步上架的 Qwen-Image-2.1-PE-T2I 模型微調自 Qwen3.5-VL 9B,具 `<think>` 推理,並以 JSON 輸出提示詞。
Hugging Face 說明證實重寫模型微調自 Qwen3.5-VL 9B,採用 <think> 標籤進行推理並以 JSON 格式輸出。
fine-tuned Qwen3.5-VL 9B
查看原始出處
outputs a JSON object
查看原始出處
<think> reasoning block
查看原始出處
系列模型採用 Qwen Research License Agreement 授權。
官方授權條款明確為 Qwen Research License Agreement。
Qwen Research License Agreement
查看原始出處
背景
Qwen-Image-2.1 的視覺生成組件採用了 DiT(Diffusion Transformer)架構,這是一種將傳統擴散模型中的 U-Net 替換為 Transformer 的技術,以處理潛在特徵區塊(latent patches)。該模型除了上架 Hugging Face,也同步發布於主打「模型即服務(Model-as-a-Service)」的 ModelScope 平台。
來源
- HF @Qwenhuggingface.co
- Hacker Newsqwen.ai
- The Decoderthe-decoder.com
- iThome 中國ithome.com
- Techmemetechmeme.com
- arxiv.org
- github.com