07 生成式 AI进阶本域第 4 篇
扩散模型
学会上千次微小的去噪,就学会了从纯噪声里造出一张图
定义
扩散模型定义一条逐步加噪的前向过程,把数据逐渐变成近似高斯噪声;再训练一个网络学习该过程的逆过程,从噪声一步步还原数据。生成时从纯噪声出发,反复应用学到的去噪步骤,最终得到样本。DDPM 把这一过程写成离散马尔可夫链,采样通常需要上千步;DDIM 等确定性采样器能在几十步内得到相近结果。
直观理解
与其要求一支笔「一气呵成」画出一幅画,不如训练它把一张被噪声糊住的照片擦干净。擦一点点,是容易学会的任务;把上千次擦拭串起来,就等于从一团纯噪声里凭空生成一张图。把难问题拆成一串小问题,正是扩散模型比 GAN 更好训练的原因。
前向加噪把图像逐步变成噪声(上排),反向去噪从噪声一步步还原图像(下排)
确定性采样器的 FID 随步数下降:DDIM 需近百步才接近饱和,DPM-Solver 等高价采样器二三十步即可达到相近质量(CIFAR-10 量级)
工作原理
- 01
前向加噪
按固定的噪声调度,逐步向数据加入高斯噪声,直到数据几乎变成纯噪声。整个过程没有可学参数,纯粹是一个破坏过程。
- 02
学习反向去噪
训练一个网络预测每一步加入的噪声(或等价地预测被污染的图像)。由于加噪过程已知,给定带噪图和步数,正确答案是确定的——这让训练退化为一个稳定的回归问题。
- 03
反向采样
从标准正态噪声出发,网络逐步估计并减去噪声,得到一个越来越清晰的样本。DDPM 的每一步都注入随机性,DDIM 则改用确定性路径,从而允许更大的步长与更少的采样步数。
- 04
无分类器引导
训练时随机丢弃条件(如文本),迫使同一个网络既能条件生成也能无条件生成。采样时把两者的预测按引导系数外推,就得到一条从「多样」到「贴题」的连续旋钮:系数越大越忠于提示,但多样性下降。
关键公式
xₜ = √(ᾱₜ) · x₀ + √(1 − ᾱₜ) · ε, ε ~ N(0, I)应用场景
- 文本到图像与图像编辑:重绘、局部修改与风格化
- 高质量图像与视频合成,包括超分辨率
- 语音与音频生成、分子与蛋白质结构生成
- 作为仿真器:从噪声重建信号,用于科学与工程反问题
常见误区
- 「扩散模型很慢」只对早期采样器成立。DDIM、DPM-Solver、蒸馏与一致性模型已把采样压缩到十几步甚至一步。
- 引导系数越大越「贴提示」是错觉。系数过高会导致过饱和、结构僵硬,并降低多样性,并非严格更好。
- 在像素空间直接运行的开销很大,高分辨率下尤为明显——这正是潜空间扩散的动机。
关键术语
- 噪声调度
- 每一步加噪量的时间表,以 βₜ 或 ᾱₜ 描述
- DDPM
- 离散马尔可夫扩散,采样通常需上千步
- DDIM
- 确定性采样,几十步即可获得相近质量
- 无分类器引导
- 用条件与无条件预测之差外推,控制贴题程度