跳到主要內容
2026-09-21 日報
模型發布

阿里發布 7B 圖文生成與編輯模型 Qwen-Image-2.1,原生支援透明圖與最多 10 張參考圖

HF @Qwen綜合 5 家報導一手來源
已查原文 · 7 項主張

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

經查閱 Hugging Face 官方頁面、The Decoder 及 IT之家的報導,待查文章中的主張均獲證實。Qwen-Image-2.1 確為視覺部分僅有 7B 參數、採 32 層 Single-Stream DiT 架構的整合型模型,具備原生透明圖層生成、支援最多 10 張參考圖與局部標記編輯等能力。關於採用 KV cache 重用架構、可在 RTX 3090 消費級 GPU 運行且效能宣稱尚待獨立驗證等細節也符合來源。此外,提示詞模型 Qwen-Image-2.1-PE-T2I 具備 `<think>` 推理與 JSON 輸出功能,且全系列以 Qwen Research License Agreement 授權等資訊皆準確無誤。

阿里發布 Qwen-Image-2.1,整合文生圖與圖像編輯,視覺生成採 32 層 Single-Stream DiT 架構,參數 7B。

來源證實 Qwen-Image-2.1 是整合文生圖與圖像編輯的模型,且視覺生成部分擁有 7B 參數與 32層 Single-Stream DiT 架構。

将文生图与图像编辑整合

查看原始出處

仅有 7B 参数

查看原始出處

32 Single-Stream DiT layers

查看原始出處

模型原生支援透明圖像(RGBA)的生成、圖層編輯與摳圖。

來源證實該模型原生支援透明影像的生成與相關編輯功能。

原生支持透明图像

查看原始出處

編輯支援最多 10 張參考圖,可透過圓圈、遮罩或塗鴉標記指定局部編輯。

官方與報導皆提及支援最多 10 張參考圖,並允許使用者藉由圓圈、遮罩或塗鴉等標記進行局部編輯。

支持最多 10 张参考图

查看原始出處

circles, masks, or painted marks

查看原始出處

架構採用混合粒度注意力與前綴 KV cache 重用,以降低成本並加速推論。

文件提到模型架構採混合粒度注意力與 KV cache 重用機制,以提升推理效率。

mixed-granularity attention

查看原始出處

KV cache reuse

查看原始出處

官方稱效能超越多數閉源模型,可於 RTX 3090 等消費級 GPU 上運行,但尚待獨立基準測試驗證。

報導指出 Qwen 自稱效能優於多數閉源模型並可在 3090 上運行,但也強調這需要獨立基準測試來證實。

beats most closed models

查看原始出處

independent benchmarks are still pending

查看原始出處

GPUs like a 3090

查看原始出處

同步上架的 Qwen-Image-2.1-PE-T2I 模型微調自 Qwen3.5-VL 9B,具 `<think>` 推理,並以 JSON 輸出提示詞。

Hugging Face 說明證實重寫模型微調自 Qwen3.5-VL 9B,採用 <think> 標籤進行推理並以 JSON 格式輸出。

fine-tuned Qwen3.5-VL 9B

查看原始出處

outputs a JSON object

查看原始出處

<think> reasoning block

查看原始出處

系列模型採用 Qwen Research License Agreement 授權。

官方授權條款明確為 Qwen Research License Agreement。

Qwen Research License Agreement

查看原始出處
據 iThome 報導,阿里千問團隊宣布推出 Qwen-Image-2.1,將文生圖與圖像編輯整合在單一模型中。其視覺生成部分採用 32 層 Single-Stream DiT 架構,參數僅 7B。 該模型原生支援透明圖像(RGBA)的生成、圖層編輯與摳圖。在編輯功能上,支援最多 10 張參考圖同時輸入(適用於群體肖像、虛擬試穿或室內設計),並允許使用者透過圓圈、遮罩或塗鴉標記指定局部編輯。架構方面,模型採用混合粒度注意力與前綴 KV cache 重用,以降低計算成本並加速多參考圖的推論。 效能方面,官方聲稱 Qwen-Image-2.1 在自家基準測試中超越多數閉源模型,且可在 RTX 3090 等消費級 GPU 上運行;不過報導也指出,該聲明尚待獨立基準測試驗證。 此外,團隊同步於 Hugging Face 上架 Qwen-Image-2.1-PE-T2I 提示詞重寫模型。該模型微調自 Qwen3.5-VL 9B,具備 `<think>` 推理能力,能將任何語言的簡短圖像請求轉換為詳細的英文提示詞,並以 JSON 格式輸出推薦的長寬比。Qwen-Image-2.1 系列模型採用 Qwen Research License Agreement 授權。
讀原始報導

背景

Qwen-Image-2.1 的視覺生成組件採用了 DiT(Diffusion Transformer)架構,這是一種將傳統擴散模型中的 U-Net 替換為 Transformer 的技術,以處理潛在特徵區塊(latent patches)。該模型除了上架 Hugging Face,也同步發布於主打「模型即服務(Model-as-a-Service)」的 ModelScope 平台。

來源