Imagen
Genera imágenes fotorrealistas con difusión en cascada y un gran codificador de texto
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ ES
Imagen is a text-to-image model Google announced in May 2022. Its key move is to use a frozen large language model (T5-XXL) as the text encoder and to generate with cascaded diffusion: a base image at low resolution is produced first, then a series of super-resolution diffusion models enlarge it step by step. The paper showed that scaling the text encoder improved image–text alignment more than scaling the image generator alone. Imagen did not release its weights and was not offered directly to the public.
Por qué merece la pena recordarlo
It showed that the size of the text encoder is a key lever for text–image alignment and pushed the cascaded-diffusion route to the frontier of photorealistic generation, shaping the design of later models.
Especificaciones clave
- Text encoder
- Frozen T5-XXL
- Generation
- Cascaded diffusion (base + super-resolution)
- Output resolution
- 1024×1024
- Open weights
- No
Capacidades
Conceptos relacionados
Modelos de difusión
Aprende mil pequeños pasos de eliminación de ruido y podrás crear una imagen desde ruido puro
Generación multimodal
Un mismo modelo que aprende a hablar, dibujar, moverse e incluso modelar el mundo 3D
Mecanismo de atención
Cada posición puede mirar directamente a todas las demás y repartir su atención según la relevancia
Productos similares
DALL·E 3
2023Reescribe un prompt largo en una descripción detallada y luego dibuja la imagen
Stable Diffusion
2022Liberó los pesos de texto a imagen y los hizo caber en GPU de consumo
Midjourney
2022Un servicio de texto a imagen conocido por su estilo estético
FLUX
2024Genera imágenes de alta resolución con un transformer de flujo rectificado