美圖影像研究院於 ICML 2026 發表 Self-Prompting 場景文本編輯方案,已應用於美圖秀秀「無痕改字」
該方案基於多模態擴散 Transformer,透過字形與風格提示進行端到端編輯,在 AnyText 與多語種測試集 MSTEdit 均達最優效能,並支援長尾與未知字元。
InfoQ 中國多家報導
47 則值得知道的變化
該方案基於多模態擴散 Transformer,透過字形與風格提示進行端到端編輯,在 AnyText 與多語種測試集 MSTEdit 均達最優效能,並支援長尾與未知字元。
該平台以 ComfyUI 畫布為基礎,用戶只需輸入自然語言,系統即會自動調用 GPT-Image-2 與 H3 等模型,完成從配樂、字幕到最長 1 分鐘 MV 的生成,並支援模板重複使用。