跳到正文
AI 图鉴

Imagen

用级联扩散与大型文本编码器生成写实图像

Google DeepMind 模型 闭源
输入文本图像

它是什么

Imagen 是 Google 于 2022 年 5 月公布的文生图模型。它的关键做法是把一个冻结的大型语言模型(T5-XXL)用作文本编码器,并采用级联扩散:先在小分辨率上生成基础图像,再由若干超分辨率扩散模型逐级放大到高分辨率。论文显示,扩大文本编码器的规模比单纯增大图像生成器更能提升图像与文本的对齐度。Imagen 未开放权重,也未直接面向公众提供。

为什么值得记住

它证明了「文本编码器的规模」是文生图文本对齐的关键变量,并把级联扩散这一路线推到写实生成的前沿,影响了后续一批模型的设计。

关键规格

文本编码器
冻结的 T5-XXL
生成方式
级联扩散(基础加超分辨率)
输出分辨率
1024×1024
开放权重
否

所属能力

相关概念

同类产品