Imagen
Gera imagens fotorrealistas com difusão em cascata e um grande codificador de texto
O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE É
Imagen is a text-to-image model Google announced in May 2022. Its key move is to use a frozen large language model (T5-XXL) as the text encoder and to generate with cascaded diffusion: a base image at low resolution is produced first, then a series of super-resolution diffusion models enlarge it step by step. The paper showed that scaling the text encoder improved image–text alignment more than scaling the image generator alone. Imagen did not release its weights and was not offered directly to the public.
Por que vale a pena lembrar
It showed that the size of the text encoder is a key lever for text–image alignment and pushed the cascaded-diffusion route to the frontier of photorealistic generation, shaping the design of later models.
Especificações-chave
- Text encoder
- Frozen T5-XXL
- Generation
- Cascaded diffusion (base + super-resolution)
- Output resolution
- 1024×1024
- Open weights
- No
Capacidades
Conceitos relacionados
Modelos de difusão
Aprenda mil pequenos passos de remoção de ruído e criará uma imagem a partir de ruído puro
Geração multimodal
Um único modelo que aprende a falar, desenhar, mover-se e até modelar o mundo 3D
Mecanismo de atenção
Cada posição pode olhar diretamente para todas as outras e distribuir atenção conforme a relevância
Produtos semelhantes
DALL·E 3
2023Reescreve um prompt longo em descrição detalhada e depois desenha a imagem
Stable Diffusion
2022Abriu os pesos de texto para imagem e os tornou executáveis em GPUs de consumo
Midjourney
2022Um serviço de texto para imagem conhecido pelo estilo estético
FLUX
2024Gera imagens de alta resolução com um transformer de fluxo retificado