跳到正文
AI 图鉴
07 生成式 AI进阶本域第 6 篇

多模态生成

同一个模型,同时学会说、画、动——甚至建模三维世界

定义

多模态生成指用统一的模型处理并生成多种模态的内容,例如由文本生成图像、视频、音频与三维结构。核心思路是把不同模态都切成离散 token 或连续潜表示,交给同一套序列建模或扩散机制处理:视频被切分为时空补丁,语音被编码成声学 token,三维场景被表示为辐射场或高斯点云。

直观理解

文本、图像、视频、声音,本质上是同一段信息在不同「载体」上的采样方式。视频不过是加了时间轴的图像序列,音频不过是采样率极高的波形,三维不过是多角度图像的几何一致版本。一旦模型学会在统一表示上预测「下一个单元」,模态之间的墙就变成了一道翻译题,而不是三套互不相通的方法论。

图 1

生成式 AI 的关键里程碑:从 VAE 与 GAN,到扩散、潜空间扩散,再到三维与视频生成

2013变分自编码器 VAE给出可采样的隐空间,为生成建模提供概率框架2014生成对抗网络 GAN以对抗博弈替代似然,生成质量成为焦点2015扩散模型理论雏形非平衡热力学给出逐步加噪再反向去噪的框架2020去噪扩散概率模型 DDPM把扩散带入实用,生成质量追上并超过 GAN2021CLIP 与 DALL·E文本与图像在共享空间对齐,开启文生图2022潜空间扩散Stable Diffusion 把扩散搬到高效潜空间并开源普及2023三维高斯泼溅快速可微的三维场景表示,推动三维生成2024文生视频扩散扩展到时空补丁,生成连贯视频
图 2

四类模态生成能力的相对成熟度(定性评估:画质、跨步一致性、可控性、低成本、数据可得性,越高越好)

  • 图像生成
  • 视频生成
  • 语音合成
  • 三维生成

工作原理

  1. 01

    统一分词:把每种模态切成单元

    文本切成子词 token,图像切成小块补丁,视频切成时空补丁,音频切成离散声学码。切成单元之后,剩下的任务在结构上与语言建模并无二致。

  2. 02

    时空补丁化:视频的额外维度

    视频相比图像多出一个时间轴。主流做法是把若干连续帧同位置的补丁组成「管状」补丁,或先编码关键帧再插值中间帧,从而在可控的算力下建模运动。

  3. 03

    语音与三维的专门表示

    语音合成通常先用声学模型把文本转成中间声学特征,再由声码器还原波形;三维则用神经辐射场(NeRF)或三维高斯泼溅表示场景,再让扩散模型生成或编辑这些表示。

  4. 04

    走向统一模型

    从「每个模态各训一个模型」逐渐转向「一个骨干处理所有模态」。代价是不同模态的算力需求、采样率与评估方式差异极大,统一训练往往需要在数据配比与损失权重上仔细平衡。

图 3

视频被切分为「帧 × 空间补丁」的网格;同一列构成跨时间的管状补丁(tubelet),是文生视频建模运动的基本单元

0.20.70.30.10.240.680.330.120.270.650.360.140.30.630.40.17

应用场景

  • 文生视频与视频编辑、动画与特效辅助
  • 语音合成、语音克隆与音乐生成
  • 三维内容创作:物体、场景与数字人的重建与生成
  • 统一助手:同一模型完成理解与生成,支持跨模态对话

常见误区

  • 视频生成的难点不在单帧画质,而在时间一致性:帧间抖动、物体突变与物理不合理是主要失败模式。
  • 三维生成的评估远比二维困难:二维指标无法衡量几何一致性,而真值本身往往难以获得。
  • 「多模态统一」不等于能力可加。合并骨干可能牺牲单模态的峰值性能,模态之间的负迁移真实存在。

关键术语

时空补丁
视频中跨帧的局部单元,用于建模运动
声码器
把声学特征还原为波形的组件
NeRF
用神经网络表示场景辐射场,支持新视角合成
三维高斯泼溅
用大量三维高斯椭球表示场景,渲染快速

延伸阅读