具身智能观察

从中文到小语种都能无痕修改,美图影像研究院(MT Lab)提出全新场景文本编辑方案 | ICML 2026

产业动态

来源:InfoQ 中文发布时间待核实

“把这几个字改下,其它的什么都别动。”——这个需求看似简单,实则很难完成,因为经常会出现文字抠不出来、找不到字体,背景有修改痕迹等等问题,即使是专业设计师,也很难做到“看不出来改过”。 目前,基于扩散模型的图像修复实现了“无需分层文件,即可修改文字”,但文字修改只要有一点瑕疵,就容易暴露破绽,所以如何实现真正的“无痕”改字有很高的难度。 当前主流的两个方法分别是“依赖图像修补”和“依赖OCR或固定字表”的建模方式,但前者容易丢失原始文本区域关键信息,导致字体细节和风格一致性下降;后者则容易限制模型在多语言和开放词汇场景下的泛化能力。 对此,美图影像研究院(MT Lab)提出了一种面向开放词汇的自提示(Self-Prompting)场景文本编辑方案,通过直接从输入图像中提取风格信息,并结合目标文本生成高保真的字形提示,将二者与原图进行统一建模,从而实现无需额外编码器的端到端编辑。该成果近期已被机器学习领域三大顶级会议之一的ICML 2026录用。 论文链接:https://arxiv.org/abs/2605.15523项目主页:https://hongxiii.github.io/ms…

从中文到小语种都能无痕修改,美图影像研究院(MT Lab)提出全新场景文本编辑方案 | ICML 2026 | 具身智能观察