阿里發布 7B 圖文生成與編輯模型 Qwen-Image-2.1,原生支援透明圖與最多 10 張參考圖
視覺生成僅 7B 參數,可在 RTX 3090 運行,官方稱效能超越多數閉源模型;同步推出基於 Qwen3.5-VL 9B 的提示詞重寫模型。
HF @Qwen綜合 5 家一手來源
20 則值得知道的變化
視覺生成僅 7B 參數,可在 RTX 3090 運行,官方稱效能超越多數閉源模型;同步推出基於 Qwen3.5-VL 9B 的提示詞重寫模型。
清華大學針對肉眼難以察覺的影像問題提出「視覺源幻覺」新方法,宣稱僅需使用 0.9% 的資料量即可達到 SOTA 表現。
該技術讓模型學習糾正自身輸出偏差以解決幀錯誤累積問題,預期能降低 GPU 成本並應用於機器人訓練,官方尚未公布上線時間。