跳到主要內容
2026-08-21 日報
研究與評測

美圖影像研究院於 ICML 2026 發表 Self-Prompting 場景文本編輯方案,已應用於美圖秀秀「無痕改字」

InfoQ 中國多家報導
尚未逐項核實

多個報導來源提及此事;未必是彼此獨立的證據。

美圖影像研究院(MT Lab)提出面向開放詞彙的自提示(Self-Prompting)場景文本編輯方案,論文已被 ICML 2026 錄用。 該方案基於多模態擴散 Transformer,透過渲染目標文本生成字形提示(glyph prompt),並從原圖目標區域提取像素級風格提示(style prompt),將兩者與完整輸入圖像在像素空間拼接,實現無需額外編碼器的端到端編輯。 模型採用兩階段訓練:第一階段為自監督預訓練,基於大規模圖文資料學習基礎生成與修復能力;第二階段為冷卻(cooldown)訓練,使用約 4,000 對高品質配對資料進行微調,在潛空間中對原圖與目標圖進行插值,解耦內容生成與風格保持。 評測顯示,該方案在中英文基準 AnyText 及包含 11 種語言的多語種測試集 MSTEdit 中均取得最優效能,並對長尾字元與手動設計符號等 OOV(Out-Of-Vocabulary)展現魯棒性。 目前該技術已應用於美圖秀秀「無痕改字」功能,突破傳統改字預設詞表限制,支援日、俄、韓、泰等小語種的文本編輯。
讀原始報導

背景

當前主流的場景文字編輯方法常面臨字體細節遺失或泛化能力受限等問題,例如曾入選 ICLR 2024 Spotlight 的 AnyText 便是該領域常用的中英文評估基準之一。為了解決無痕修改的難題,美圖影像研究院(MT Lab)提出基於多模態擴散 Transformer 的全新方案,並在 AnyText 等基準上取得最優性能。

來源