Imagen
Génère des images photoréalistes par diffusion en cascade et un grand encodeur de texte
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE C'EST
Imagen is a text-to-image model Google announced in May 2022. Its key move is to use a frozen large language model (T5-XXL) as the text encoder and to generate with cascaded diffusion: a base image at low resolution is produced first, then a series of super-resolution diffusion models enlarge it step by step. The paper showed that scaling the text encoder improved image–text alignment more than scaling the image generator alone. Imagen did not release its weights and was not offered directly to the public.
Pourquoi il compte
It showed that the size of the text encoder is a key lever for text–image alignment and pushed the cascaded-diffusion route to the frontier of photorealistic generation, shaping the design of later models.
Caractéristiques clés
- Text encoder
- Frozen T5-XXL
- Generation
- Cascaded diffusion (base + super-resolution)
- Output resolution
- 1024×1024
- Open weights
- No
Capacités
Concepts liés
Modèles de diffusion
Apprenez mille petits pas de débruitage et vous créerez une image à partir de bruit pur
Génération multimodale
Un seul modèle qui apprend à parler, dessiner, bouger — et même à modéliser le monde 3D
Mécanisme d’attention
Chaque position peut regarder directement toutes les autres et répartir dynamiquement son attention selon la pertinence
Produits comparables
DALL·E 3
2023Réécrit une longue consigne en description détaillée, puis dessine l’image
Stable Diffusion
2022A libéré les poids texte-image et les a rendus exécutables sur des GPU grand public
Midjourney
2022Un service texte-image réputé pour son style esthétique
FLUX
2024Génère des images haute résolution avec un transformer à flux rectifié