图生图
以一张图为底稿重新生成相似的图
图像生成与编辑入门 #19
输入图像图像
这项能力指什么
输入一张图像,输出内容相似但在风格或细节上被改写的新图。控制相似度的旋钮通常是加噪强度:加噪少则结果贴近原图,加噪多则更像重新创作。它与「图像编辑」的区别是不要求用文字指令指定改哪里,而是整体风格化或重新演绎。
技术上如何做到
做法是在扩散流程里把输入图先编码进潜空间,再按设定的步数加噪到某一时刻,从那一点开始反向去噪,于是输出既保留原图结构又带上新风格。要更细的控制就叠加条件分支:边缘、深度、姿态或参考图风格各自作为额外条件输入,这在补全与线稿上色等场景里尤其常见。
代表产品
6Stable Diffusion
2022Stability AI
把文生图权重开源,并压到消费级显卡可运行
模型 开放权重
文本图像图像
FLUX
2024Black Forest Labs
用整流流 Transformer 生成高分辨率图像
模型 开放权重
文本图像图像
Firefly
2023Adobe
面向创作者的图像生成与编辑工具
应用 闭源
图像文本图像
Diffusers
2022Hugging Face
扩散模型的统一实现与调度
工具 开源
Seedream
2024ByteDance (Seed)
原生高分辨率、擅长文字排版的文生图模型
模型 闭源
文本图像
Midjourney
2022Midjourney
以审美风格见长的文生图服务
应用 闭源
文本图像图像
相关机构
典型用途
- 风格迁移与照片风格化
- 草图、线稿上色与补全
- 低模到成品的概念迭代
- 同一主题的系列化变体
怎么评价它好不好
- FID
- 生成结果与目标分布的差距
- LPIPS 感知距离
- 与输入图在感知层面的差异程度
- 结构一致性
- 轮廓与主体位置相对原图的保持程度
边界与难点
- 保留结构还是大幅改写难以精确控制,同一组参数在不同图上表现差别很大
- 强度调高时内容会漂移,人脸与文字等细节最先被改掉
- 整图重绘会破坏原有的版式与排版,海报与界面截图难以原样保留