跳到主要內容
2026-08-06 日報
模型發布

Qwen-Image-3.0-Pro 圖像生成模型上線:支援 4.5k token 輸入、12 種語言渲染與複雜排版

Hacker News單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 QwenCloud 官網資訊,新一代圖像生成模型 Qwen-Image-3.0-Pro 已上線,主打高密度資訊排版與生產力應用。該模型支援高達 4.5k token 的輸入,能一次性生成報紙、分鏡圖、菜單與考卷等複雜排版(畫中畫),並具備 12 種語言與 20 多種字體的原生渲染能力,可精準呈現小至 10px 的文字。在圖像細節表現上,模型能逼真還原微表情、毛孔與髮絲,並可模擬網頁、遊戲與直播等主流介面。API 支援前綴補全(Prefix Completion)、函數呼叫(Function Calling)、上下文快取(Context Cache)與結構化輸出等開發功能。定價方面,1K 與 2K 圖像輸入皆為每張 0.003 美元,1K 圖像輸出為每張 0.04 美元,2K 圖像輸出為每張 0.075 美元;目前 API 速率限制為每分鐘 1 次請求(1 RPM)。
讀原始報導

背景

Qwen(通義千問)是由阿里雲開發的大型語言模型系列。該系列涵蓋了採用開源授權的版本,以及透過阿里雲提供服務的專有模型。

社群討論

社群認為此模型雖有進步,但在 UI 設計與 Arena.ai 評分(1263 對 1380)上仍不及 gpt-image-2,不過其單張圖片成本僅 0.04 美元,遠低於對手的 0.21 美元。許多使用者抱怨官方網站強制要求綁定信用卡甚至上傳駕照才能試用,導致體驗極差。此外,鑑於前代模型未如期開源,多數人對釋出權重不抱期望,認為官方已轉向封閉的專有模型。

來源