跳到正文
AI 图鉴

文生图

用一句描述生成一张图

图像生成与编辑入门 #18
输入文本图像

这项能力指什么

把自然语言描述直接映射为图像,输入是文字,输出是像素,两者中间没有标注或参考图。它与「图生图」的区别是完全没有输入图像,与「图像编辑」的区别是不针对已有画面做修改,而是从零合成一张新图。

技术上如何做到

主流路线是潜空间扩散:文本经编码器变成条件向量,通过交叉注意力注入去噪网络,在压缩后的潜空间里逐步去噪,最后解码成像素。条件注入方式后来扩展出无分类器引导,用有无提示两个方向的差来强化遵循度。训练数据是海量图文对,DALL·E 3 把提示词改写与生成耦合进同一条流程,显著改善了长提示的遵循。

代表产品

7

相关机构

典型用途

  • 概念设计与分镜草图
  • 营销素材与插画
  • 游戏与影视的前期视觉
  • 个性化头像与壁纸

怎么评价它好不好

FID
与真实图像分布的差距,越低越好
CLIP 分数
生成图与提示词的语义一致度
人工偏好 Elo
成对比较得出的偏好排序

边界与难点

  • 计数、精确空间关系(左三右二)与排列顺序仍然不可靠
  • 画面里出现文字时字符经常错乱,长串文字尤其如此
  • 手部、肢体与工具接触部位的结构容易崩坏,需要多张重抽

背后的概念