模型發布
商湯開源 SenseNova U1.5-Lite-Preview:8B-MoT 原生支援 4K 影像生成與迭代編輯
AI 科技評論多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。
據 AI 科技評論報導,商湯科技已向全球使用者開源 SenseNova U1.5-Lite-Preview;這款 8B-MoT 原生統一多模態模型在單一架構內整合視覺理解、推理、生成與編輯,並原生支援 4K 影像生成。
相較今年 4 月發布的 SenseNova U1,新版本強化局部紋理、真實世界材質、中英文文字生成、複雜版面組織、視覺指令遵循與連續編輯。模型可理解長篇自然語言及結構化創作指令;公開案例包括使用 1,675 詞 prompt 製作中英雙語資訊圖,以及使用 3,880 詞 prompt 生成解析度達 4K、長寬比 10:3 的 WAIC 發展歷程長卷。
商湯另提供實驗性 Prompt Enhance Skill,可將簡短構想整理成包含主體、版面、風格、文字與限制條件的完整創作方案。編輯工作流程涵蓋參考圖風格遷移、多參考圖元素融合、人物與產品身分保持、資訊圖元素定向修改、實景文字替換,以及透過區域、座標或 marker 指定編輯範圍。
架構方面,SenseNova U1.5-Lite-Preview 採用 encoder-free 視覺建模,避免固定視覺編碼器造成的資訊壓縮;同時重新設計生成頭,以減少視覺 Token 網格造成的拼接痕跡與紋理斷裂,並將訓練解析度擴展至 4K。針對編輯時的主體漂移及非編輯區域變動,商湯也重新組織編輯資料與訓練任務,以加強原圖內容、主體身分、空間結構及未修改區域的保留能力。
商湯公布的評測顯示,Qwen-Image-Bench 分數由 U1 的 47.14 提升至 55.20,但新版成績使用 Prompt Enhance;ImgEdit-Bench 由 3.90 升至 4.37,GEdit-Bench-en 由 7.47 升至 8.17,GEdit-Bench-zh 則由 7.42 升至 8.05。模型目前已於 GitHub、Hugging Face 與魔搭社群提供下載。
讀原始報導背景
SenseNova U1 先前已開源 Lite 系列,提供兩種規模,其中 SenseNova U1-8B-MoT 採用 dense backbone。使用者也可透過免費的 SenseNova-Studio 直接在瀏覽器體驗 U1,無須安裝軟體或使用 GPU。
來源
- 量子位qbitai.com
- huggingface.co
- github.com