跳到正文
AI 图鉴
07 生成式 AI入门本域第 1 篇

生成模型总览

判别模型回答「这是什么」,生成模型回答「它应该长什么样」

定义

判别模型学习条件分布 p(y|x),给定输入直接输出标签;生成模型学习数据本身的分布 p(x),目标是能从中采样出与训练数据同分布、但不重复的新样本。二者的关键分野在于建模对象:前者画出一条边界,后者重建整片地形。生成模型还常被要求支持条件生成 p(x|y),即用文本、类别或草图控制输出。

直观理解

想象一场考试。判别题只问「这张照片是猫还是狗」,答对即可;生成题却要求你「画一只猫」,而且要让阅卷人相信这是真猫。前者只要抓住两类之间的区别,后者却必须了解猫的一切——耳朵的形状、毛发的走向、姿态的合理范围。也正因如此,生成往往更难:你要模仿的不是一条边界,而是整份数据的样子。

图 1

判别与生成的分野:一个只回答「是哪一类」,一个必须重建「整片分布」

图 2

同一数据集上的训练曲线:对抗训练的 FID 早期下降快,后期却反复震荡反弹;去噪扩散则平稳单调(量级示意,越低越好)

  • 对抗训练(GAN)
  • 去噪扩散(Diffusion)

工作原理

  1. 01

    确定要学的分布

    先明确目标:是无条件地模仿整个数据集 p(x),还是在给定条件(文本、类别)下生成 p(x|y)。这一选择决定了模型的输出接口,也决定了训练信号从哪里来。

  2. 02

    选择建模方式:显式还是隐式

    显式密度模型(自回归、VAE、扩散)写出或逼近 p(x) 的函数形式,可以用似然来训练;隐式密度模型(GAN)不给出概率,只提供一个采样器,靠「像不像」的对抗信号来学。前者目标清晰但受限,后者自由却难训。

  3. 03

    用似然或对抗信号优化

    自回归把联合概率拆成逐项预测的乘积;VAE 优化数据似然的下界;扩散把生成拆成上千步去噪;GAN 让判别器充当可学习的损失函数。四条路线对「像」给出了四种数学表述。

  4. 04

    用指标与人工评估检验质量

    FID 比较生成分布与真实分布在 Inception 特征空间中的距离,IS 衡量单张图的清晰度与多样性,二者都只是代理。最终可信的裁判仍是人的偏好,无论是问卷还是成对的竞技场投票。

图 3

四条主流技术路线:它们对「像」给出了不同的数学定义

生成模型生成模型自回归自回归逐项预测,似然清晰逐项预测,似然清晰自编码器自编码器先压缩到瓶颈再重建先压缩到瓶颈再重建对抗对抗生成器对判别器,隐式密度生成器对判别器,隐式密度扩散扩散逐步去噪,稳定可训逐步去噪,稳定可训
图 4

四类路线代表模型在 ImageNet 256×256 上的 FID 量级(越低越好;自回归取 VQGAN+Transformer,自编码器取 VQGAN,对抗取 BigGAN-deep,扩散取 DiT-XL/2)

应用场景

  • 图像与视频生成:从文本、草图或参考图合成新的视觉内容
  • 语音与音乐合成:文本转语音、歌声合成、音乐续写
  • 数据增强与仿真:为稀缺类别合成训练样本,或为自动驾驶生成合成场景
  • 科学设计:生成候选分子、蛋白质结构或芯片布局

常见误区

  • 「生成得逼真」不等于「学到了正确分布」。高保真但多样性不足(模式崩塌)的模型,在 FID 上看似不错,实际只覆盖了数据的一小部分。
  • FID、IS 依赖固定的特征网络,换一个特征提取器,排名就可能翻转;它们与人的直觉只是相关,而非等价。
  • 生成模型的输出没有「正确答案」。同一个提示可以对应无数合理结果,评估时必须区分「不真实」与「不常见」。

关键术语

显式密度
能写出或逼近 p(x) 的模型,如自回归与扩散
隐式密度
只提供采样器、不给出概率的模型,如 GAN
模式崩塌
生成器只覆盖数据分布的少数几个模式
FID
生成分布与真实分布在 Inception 特征空间中的 Fréchet 距离,越低越好

延伸阅读