Текст в изображение
Превратить фразу в изображение
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО ЗА ВОЗМОЖНОСТЬ
Maps a natural-language description directly to an image: text in, pixels out, with no annotation or reference image in between. Unlike image-to-image it has no input image at all, and unlike image editing it does not modify an existing picture but synthesises a new one from scratch.
Как это устроено
The dominant route is latent diffusion: the prompt is encoded into a conditioning vector, injected into a denoising network through cross-attention, denoised step by step in a compressed latent space, and decoded to pixels. Conditioning was later extended by classifier-free guidance, which amplifies prompt adherence by contrasting the conditioned and unconditioned directions. Training uses vast image–text pairs, and DALL·E 3 coupled prompt rewriting with generation in one pipeline, markedly improving adherence to long prompts.
Примеры продуктов
7DALL·E 3
2023Сначала переписывает длинный запрос в подробное описание, затем рисует изображение
Midjourney
2022Сервис генерации изображений, известный своим эстетическим стилем
Stable Diffusion
2022Открыла веса генерации изображений и сделала их посильными для потребительских видеокарт
FLUX
2024Создаёт изображения высокого разрешения с помощью трансформера rectified flow
Imagen
2022Создаёт фотореалистичные изображения каскадной диффузией и крупным текстовым энкодером
Seedream
2024Модель текст-изображение с нативным высоким разрешением и хорошей отрисовкой текста
Firefly
2023Инструмент генерации и редактирования изображений для авторов
Связанные организации
Типичное применение
- Concept design and storyboards
- Marketing assets and illustration
- Pre-visualisation for games and film
- Personalised avatars and wallpapers
Как её оценивают
- FID
- Distance to the real image distribution; lower is better
- CLIP score
- Semantic agreement between image and prompt
- Human-preference Elo
- Preference ranking from pairwise comparison
Границы и трудности
- Counting, precise spatial relations and ordering remain unreliable
- Letters inside the image are frequently garbled, especially in long strings
- Hands, limbs and object-contact points break down, often needing several resamples
Концепции в основе
Диффузионные модели
Научитесь тысяче мелких шагов удаления шума — и соберёте изображение из чистого шума
Диффузия в латентном пространстве и условное управление
Проводить диффузию не по пикселям, а внутри сжатого смыслового пространства
Обзор порождающих моделей
Дискриминативные модели отвечают «что это», порождающие — «как это должно выглядеть»