输入文本图像
它是什么
Imagen 是 Google 于 2022 年 5 月公布的文生图模型。它的关键做法是把一个冻结的大型语言模型(T5-XXL)用作文本编码器,并采用级联扩散:先在小分辨率上生成基础图像,再由若干超分辨率扩散模型逐级放大到高分辨率。论文显示,扩大文本编码器的规模比单纯增大图像生成器更能提升图像与文本的对齐度。Imagen 未开放权重,也未直接面向公众提供。
为什么值得记住
它证明了「文本编码器的规模」是文生图文本对齐的关键变量,并把级联扩散这一路线推到写实生成的前沿,影响了后续一批模型的设计。
关键规格
- 文本编码器
- 冻结的 T5-XXL
- 生成方式
- 级联扩散(基础加超分辨率)
- 输出分辨率
- 1024×1024
- 开放权重
- 否