生成模型总览
判别模型回答「这是什么」,生成模型回答「它应该长什么样」
定义
判别模型学习条件分布 p(y|x),给定输入直接输出标签;生成模型学习数据本身的分布 p(x),目标是能从中采样出与训练数据同分布、但不重复的新样本。二者的关键分野在于建模对象:前者画出一条边界,后者重建整片地形。生成模型还常被要求支持条件生成 p(x|y),即用文本、类别或草图控制输出。
直观理解
想象一场考试。判别题只问「这张照片是猫还是狗」,答对即可;生成题却要求你「画一只猫」,而且要让阅卷人相信这是真猫。前者只要抓住两类之间的区别,后者却必须了解猫的一切——耳朵的形状、毛发的走向、姿态的合理范围。也正因如此,生成往往更难:你要模仿的不是一条边界,而是整份数据的样子。
判别与生成的分野:一个只回答「是哪一类」,一个必须重建「整片分布」
同一数据集上的训练曲线:对抗训练的 FID 早期下降快,后期却反复震荡反弹;去噪扩散则平稳单调(量级示意,越低越好)
- 对抗训练(GAN)
- 去噪扩散(Diffusion)
工作原理
- 01
确定要学的分布
先明确目标:是无条件地模仿整个数据集 p(x),还是在给定条件(文本、类别)下生成 p(x|y)。这一选择决定了模型的输出接口,也决定了训练信号从哪里来。
- 02
选择建模方式:显式还是隐式
显式密度模型(自回归、VAE、扩散)写出或逼近 p(x) 的函数形式,可以用似然来训练;隐式密度模型(GAN)不给出概率,只提供一个采样器,靠「像不像」的对抗信号来学。前者目标清晰但受限,后者自由却难训。
- 03
用似然或对抗信号优化
自回归把联合概率拆成逐项预测的乘积;VAE 优化数据似然的下界;扩散把生成拆成上千步去噪;GAN 让判别器充当可学习的损失函数。四条路线对「像」给出了四种数学表述。
- 04
用指标与人工评估检验质量
FID 比较生成分布与真实分布在 Inception 特征空间中的距离,IS 衡量单张图的清晰度与多样性,二者都只是代理。最终可信的裁判仍是人的偏好,无论是问卷还是成对的竞技场投票。
四条主流技术路线:它们对「像」给出了不同的数学定义
四类路线代表模型在 ImageNet 256×256 上的 FID 量级(越低越好;自回归取 VQGAN+Transformer,自编码器取 VQGAN,对抗取 BigGAN-deep,扩散取 DiT-XL/2)
应用场景
- 图像与视频生成:从文本、草图或参考图合成新的视觉内容
- 语音与音乐合成:文本转语音、歌声合成、音乐续写
- 数据增强与仿真:为稀缺类别合成训练样本,或为自动驾驶生成合成场景
- 科学设计:生成候选分子、蛋白质结构或芯片布局
常见误区
- 「生成得逼真」不等于「学到了正确分布」。高保真但多样性不足(模式崩塌)的模型,在 FID 上看似不错,实际只覆盖了数据的一小部分。
- FID、IS 依赖固定的特征网络,换一个特征提取器,排名就可能翻转;它们与人的直觉只是相关,而非等价。
- 生成模型的输出没有「正确答案」。同一个提示可以对应无数合理结果,评估时必须区分「不真实」与「不常见」。
关键术语
- 显式密度
- 能写出或逼近 p(x) 的模型,如自回归与扩散
- 隐式密度
- 只提供采样器、不给出概率的模型,如 GAN
- 模式崩塌
- 生成器只覆盖数据分布的少数几个模式
- FID
- 生成分布与真实分布在 Inception 特征空间中的 Fréchet 距离,越低越好