Перейти к содержимому
Атлас ИИ

Текст в изображение

Превратить фразу в изображение

Генерация и редактирование изображенийНачальный #18
входТекстИзображение

Полный текст статьи представлен на английском; заголовок и аннотация локализованы.

ЧТО ЭТО ЗА ВОЗМОЖНОСТЬ

Maps a natural-language description directly to an image: text in, pixels out, with no annotation or reference image in between. Unlike image-to-image it has no input image at all, and unlike image editing it does not modify an existing picture but synthesises a new one from scratch.

Как это устроено

The dominant route is latent diffusion: the prompt is encoded into a conditioning vector, injected into a denoising network through cross-attention, denoised step by step in a compressed latent space, and decoded to pixels. Conditioning was later extended by classifier-free guidance, which amplifies prompt adherence by contrasting the conditioned and unconditioned directions. Training uses vast image–text pairs, and DALL·E 3 coupled prompt rewriting with generation in one pipeline, markedly improving adherence to long prompts.

Примеры продуктов

7

DALL·E 3

2023
OpenAI

Сначала переписывает длинный запрос в подробное описание, затем рисует изображение

Модель Закрытый
ТекстИзображение

Midjourney

2022
Midjourney

Сервис генерации изображений, известный своим эстетическим стилем

Приложение Закрытый
ТекстИзображениеИзображение

Stable Diffusion

2022
Stability AI

Открыла веса генерации изображений и сделала их посильными для потребительских видеокарт

Модель Открытые веса
ТекстИзображениеИзображение

FLUX

2024
Black Forest Labs

Создаёт изображения высокого разрешения с помощью трансформера rectified flow

Модель Открытые веса
ТекстИзображениеИзображение

Imagen

2022
Google DeepMind

Создаёт фотореалистичные изображения каскадной диффузией и крупным текстовым энкодером

Модель Закрытый
ТекстИзображение

Seedream

2024
ByteDance (Seed)

Модель текст-изображение с нативным высоким разрешением и хорошей отрисовкой текста

Модель Закрытый
ТекстИзображение

Firefly

2023
Adobe

Инструмент генерации и редактирования изображений для авторов

Приложение Закрытый
ИзображениеТекстИзображение

Связанные организации

Типичное применение

  • Concept design and storyboards
  • Marketing assets and illustration
  • Pre-visualisation for games and film
  • Personalised avatars and wallpapers

Как её оценивают

FID
Distance to the real image distribution; lower is better
CLIP score
Semantic agreement between image and prompt
Human-preference Elo
Preference ranking from pairwise comparison

Границы и трудности

  • Counting, precise spatial relations and ordering remain unreliable
  • Letters inside the image are frequently garbled, especially in long strings
  • Hands, limbs and object-contact points break down, often needing several resamples

Концепции в основе