文生图
用一句描述生成一张图
图像生成与编辑入门 #18
输入文本图像
这项能力指什么
把自然语言描述直接映射为图像,输入是文字,输出是像素,两者中间没有标注或参考图。它与「图生图」的区别是完全没有输入图像,与「图像编辑」的区别是不针对已有画面做修改,而是从零合成一张新图。
技术上如何做到
主流路线是潜空间扩散:文本经编码器变成条件向量,通过交叉注意力注入去噪网络,在压缩后的潜空间里逐步去噪,最后解码成像素。条件注入方式后来扩展出无分类器引导,用有无提示两个方向的差来强化遵循度。训练数据是海量图文对,DALL·E 3 把提示词改写与生成耦合进同一条流程,显著改善了长提示的遵循。
代表产品
7DALL·E 3
2023OpenAI
把长提示词先改写成详细描述,再据此生成图像
模型 闭源
文本图像
Midjourney
2022Midjourney
以审美风格见长的文生图服务
应用 闭源
文本图像图像
Stable Diffusion
2022Stability AI
把文生图权重开源,并压到消费级显卡可运行
模型 开放权重
文本图像图像
FLUX
2024Black Forest Labs
用整流流 Transformer 生成高分辨率图像
模型 开放权重
文本图像图像
Imagen
2022Google DeepMind
用级联扩散与大型文本编码器生成写实图像
模型 闭源
文本图像
Seedream
2024ByteDance (Seed)
原生高分辨率、擅长文字排版的文生图模型
模型 闭源
文本图像
Firefly
2023Adobe
面向创作者的图像生成与编辑工具
应用 闭源
图像文本图像
相关机构
典型用途
- 概念设计与分镜草图
- 营销素材与插画
- 游戏与影视的前期视觉
- 个性化头像与壁纸
怎么评价它好不好
- FID
- 与真实图像分布的差距,越低越好
- CLIP 分数
- 生成图与提示词的语义一致度
- 人工偏好 Elo
- 成对比较得出的偏好排序
边界与难点
- 计数、精确空间关系(左三右二)与排列顺序仍然不可靠
- 画面里出现文字时字符经常错乱,长串文字尤其如此
- 手部、肢体与工具接触部位的结构容易崩坏,需要多张重抽