图像编辑与局部重绘
按一句话指令改掉图中的某处
图像生成与编辑入门 #20
输入图像文本图像
这项能力指什么
输入原图、一句编辑指令,通常还有一块掩膜标明改动区域,输出修改后的图。它与「图生图」的区别是有明确的、局部的修改意图,未指定区域应尽量保持原样;与「文生图」的区别是不从零生成,而是在既有画面上做手术。
技术上如何做到
基础做法是局部重绘:只在掩膜区域内加噪并去噪,区域外直接沿用原图潜变量,指令通过交叉注意力或适配层注入。更精细的方案会额外带上参考图与身份保持分支,让被改人物的面孔不变;也有把指令与图像一起交给多模态模型、直接预测编辑后潜变量的路线。
代表产品
5相关机构
典型用途
- 电商图去杂物与换背景
- 人像修图与妆发调整
- 广告与海报的素材替换
- 旧照修复与局部补全
怎么评价它好不好
- 编辑方向一致性
- 图文编辑前后在 CLIP 语义空间上的位移是否与指令方向一致
- FID
- 编辑结果与真实图像的分布差距,防止越改越假
- 人工评分
- 按指令完成度与保持度打分
边界与难点
- 局部重绘区域的边界、光影与噪点常与周围对不上,需要多次微调
- 多条编辑要求(换衣又换背景又改表情)往往只完成其中一部分
- 改动幅度大时人物身份会漂移,同一张脸不再像本人