Imagen
Создаёт фотореалистичные изображения каскадной диффузией и крупным текстовым энкодером
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО
Imagen is a text-to-image model Google announced in May 2022. Its key move is to use a frozen large language model (T5-XXL) as the text encoder and to generate with cascaded diffusion: a base image at low resolution is produced first, then a series of super-resolution diffusion models enlarge it step by step. The paper showed that scaling the text encoder improved image–text alignment more than scaling the image generator alone. Imagen did not release its weights and was not offered directly to the public.
Почему стоит запомнить
It showed that the size of the text encoder is a key lever for text–image alignment and pushed the cascaded-diffusion route to the frontier of photorealistic generation, shaping the design of later models.
Ключевые характеристики
- Text encoder
- Frozen T5-XXL
- Generation
- Cascaded diffusion (base + super-resolution)
- Output resolution
- 1024×1024
- Open weights
- No
Возможности
Связанные концепции
Диффузионные модели
Научитесь тысяче мелких шагов удаления шума — и соберёте изображение из чистого шума
Мультимодальная генерация
Одна модель учится говорить, рисовать, двигаться — и даже моделировать трёхмерный мир
Механизм внимания
Каждая позиция может напрямую «видеть» все остальные и динамически распределять внимание по релевантности
Аналоги
DALL·E 3
2023Сначала переписывает длинный запрос в подробное описание, затем рисует изображение
Stable Diffusion
2022Открыла веса генерации изображений и сделала их посильными для потребительских видеокарт
Midjourney
2022Сервис генерации изображений, известный своим эстетическим стилем
FLUX
2024Создаёт изображения высокого разрешения с помощью трансформера rectified flow