跳到正文
AI 图鉴
07 生成式 AI专家本域第 5 篇

潜空间扩散与条件控制

不在像素上做扩散,而是在一层被压缩的语义空间里做

定义

潜空间扩散先用自编码器把图像压缩到低维潜表示,再在潜空间里运行扩散过程,最后解码回像素。Stable Diffusion 是该范式的代表:一个变分自编码器负责像素与潜表示之间的转换,一个 U-Net 在潜空间去噪,一个文本编码器通过交叉注意力把提示注入去噪过程。ControlNet、LoRA 等则在冻结主干之上外挂或微调,实现结构与风格的条件控制。

直观理解

在原始像素上扩散代价高昂:一张 512×512 的图有二十六万个数,还要反复迭代几十次。但图像的「要点」其实少得多——颜色、构图、物体关系都能用更小的表示概括。SD 的做法是先把图「缩写成提纲」,在提纲上完成创作,最后再把提纲「扩写成文章」。省下的算力以数量级计,质量基本不损失。

图 1

Stable Diffusion 的三段式结构:像素与文字各自编码,重采样全部发生在潜空间,最后由解码器还原像素

全部重采样发生在潜空间,是算力节省与高分辨率可扩展性的来源。
图 2

主流文生图模型的人工偏好 Elo(取自公开文生图竞技场榜单的量级示意,随榜单更新而变动)

工作原理

  1. 01

    压缩:训练感知自编码器

    用一个带感知损失与对抗损失的自编码器把图像压到约每边 1/8(面积 1/64)的潜表示。下采样倍数是一个权衡:压得越狠越省算力,但过强的压缩会丢掉细节。

  2. 02

    潜空间去噪

    U-Net 在潜空间上执行扩散,接收带噪潜表示与时间步,预测噪声。所有重采样都发生在低维空间,训练与推理开销随之大幅下降。

  3. 03

    交叉注意力注入文本

    文本编码器把提示变成一串向量;U-Net 的每一层通过交叉注意力让图像特征去「查询」这些文本向量,从而让提示在去噪的每个阶段都参与决策,而不只是开头的一次性条件。

  4. 04

    冻结主干上的条件控制

    ControlNet 复制编码器侧并接上一个「零卷积」旁路,用边缘、深度或姿态图引导结构;LoRA 只训练低秩增量矩阵,用小体积适配新风格。二者都不改动主干的原始权重。

图 3

交叉注意力:每个图像特征位置都可查询全部文本 token,从而在去噪每一步接收语义条件

图 4

潜空间扩散把重采样搬到约 1/64 大小的表示上,训练与采样算力大致降为像素扩散的数分之一(量级示意)

  • 像素空间扩散
  • 潜空间扩散

应用场景

  • 文本到图像、图像编辑与修复(inpainting / outpainting)
  • 结构受控生成:姿势、深度、线稿或分割图到图
  • 个性化:用 LoRA、DreamBooth 定制主体或风格
  • 视频与三维内容的高效生成:同一范式迁移到时间与空间

常见误区

  • 「潜空间」不是免费的午餐。自编码器若有信息损失,扩散再完美也无法恢复,高分辨率细节尤其脆弱。
  • LoRA 的适配是叠加而非替换。风格或主体被编码进低秩增量,与新提示可能相互干扰,权重过大还会污染原有能力。
  • ControlNet 的强度与提示必须协同。控制过强会跳过语义、照搬条件图;过弱则形同虚设。

关键术语

潜空间
自编码器压缩后的低维表示空间
交叉注意力
让图像特征查询文本向量的注意力机制
ControlNet
由条件图引导结构的旁路网络
LoRA
低秩适配增量,用于低成本定制

延伸阅读