07 生成式 AI进阶本域第 6 篇
多模态生成
同一个模型,同时学会说、画、动——甚至建模三维世界
定义
多模态生成指用统一的模型处理并生成多种模态的内容,例如由文本生成图像、视频、音频与三维结构。核心思路是把不同模态都切成离散 token 或连续潜表示,交给同一套序列建模或扩散机制处理:视频被切分为时空补丁,语音被编码成声学 token,三维场景被表示为辐射场或高斯点云。
直观理解
文本、图像、视频、声音,本质上是同一段信息在不同「载体」上的采样方式。视频不过是加了时间轴的图像序列,音频不过是采样率极高的波形,三维不过是多角度图像的几何一致版本。一旦模型学会在统一表示上预测「下一个单元」,模态之间的墙就变成了一道翻译题,而不是三套互不相通的方法论。
生成式 AI 的关键里程碑:从 VAE 与 GAN,到扩散、潜空间扩散,再到三维与视频生成
四类模态生成能力的相对成熟度(定性评估:画质、跨步一致性、可控性、低成本、数据可得性,越高越好)
- 图像生成
- 视频生成
- 语音合成
- 三维生成
工作原理
- 01
统一分词:把每种模态切成单元
文本切成子词 token,图像切成小块补丁,视频切成时空补丁,音频切成离散声学码。切成单元之后,剩下的任务在结构上与语言建模并无二致。
- 02
时空补丁化:视频的额外维度
视频相比图像多出一个时间轴。主流做法是把若干连续帧同位置的补丁组成「管状」补丁,或先编码关键帧再插值中间帧,从而在可控的算力下建模运动。
- 03
语音与三维的专门表示
语音合成通常先用声学模型把文本转成中间声学特征,再由声码器还原波形;三维则用神经辐射场(NeRF)或三维高斯泼溅表示场景,再让扩散模型生成或编辑这些表示。
- 04
走向统一模型
从「每个模态各训一个模型」逐渐转向「一个骨干处理所有模态」。代价是不同模态的算力需求、采样率与评估方式差异极大,统一训练往往需要在数据配比与损失权重上仔细平衡。
视频被切分为「帧 × 空间补丁」的网格;同一列构成跨时间的管状补丁(tubelet),是文生视频建模运动的基本单元
应用场景
- 文生视频与视频编辑、动画与特效辅助
- 语音合成、语音克隆与音乐生成
- 三维内容创作:物体、场景与数字人的重建与生成
- 统一助手:同一模型完成理解与生成,支持跨模态对话
常见误区
- 视频生成的难点不在单帧画质,而在时间一致性:帧间抖动、物体突变与物理不合理是主要失败模式。
- 三维生成的评估远比二维困难:二维指标无法衡量几何一致性,而真值本身往往难以获得。
- 「多模态统一」不等于能力可加。合并骨干可能牺牲单模态的峰值性能,模态之间的负迁移真实存在。
关键术语
- 时空补丁
- 视频中跨帧的局部单元,用于建模运动
- 声码器
- 把声学特征还原为波形的组件
- NeRF
- 用神经网络表示场景辐射场,支持新视角合成
- 三维高斯泼溅
- 用大量三维高斯椭球表示场景,渲染快速