Texto para imagem
Transformar uma frase em imagem
O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE ESTA CAPACIDADE SIGNIFICA
Maps a natural-language description directly to an image: text in, pixels out, with no annotation or reference image in between. Unlike image-to-image it has no input image at all, and unlike image editing it does not modify an existing picture but synthesises a new one from scratch.
Como é feita tecnicamente
The dominant route is latent diffusion: the prompt is encoded into a conditioning vector, injected into a denoising network through cross-attention, denoised step by step in a compressed latent space, and decoded to pixels. Conditioning was later extended by classifier-free guidance, which amplifies prompt adherence by contrasting the conditioned and unconditioned directions. Training uses vast image–text pairs, and DALL·E 3 coupled prompt rewriting with generation in one pipeline, markedly improving adherence to long prompts.
Produtos representativos
7DALL·E 3
2023Reescreve um prompt longo em descrição detalhada e depois desenha a imagem
Midjourney
2022Um serviço de texto para imagem conhecido pelo estilo estético
Stable Diffusion
2022Abriu os pesos de texto para imagem e os tornou executáveis em GPUs de consumo
FLUX
2024Gera imagens de alta resolução com um transformer de fluxo retificado
Imagen
2022Gera imagens fotorrealistas com difusão em cascata e um grande codificador de texto
Seedream
2024Um modelo texto para imagem de alta resolução nativa e bom render de texto
Firefly
2023Uma ferramenta de geração e edição de imagens para criadores
Organizações relacionadas
Usos típicos
- Concept design and storyboards
- Marketing assets and illustration
- Pre-visualisation for games and film
- Personalised avatars and wallpapers
Como avaliar se funciona bem
- FID
- Distance to the real image distribution; lower is better
- CLIP score
- Semantic agreement between image and prompt
- Human-preference Elo
- Preference ranking from pairwise comparison
Limites e dificuldades
- Counting, precise spatial relations and ordering remain unreliable
- Letters inside the image are frequently garbled, especially in long strings
- Hands, limbs and object-contact points break down, often needing several resamples
Conceitos por trás
Modelos de difusão
Aprenda mil pequenos passos de remoção de ruído e criará uma imagem a partir de ruído puro
Difusão latente e controle condicional
Fazer difusão não sobre pixels, mas dentro de um espaço semântico comprimido
Visão geral dos modelos generativos
Modelos discriminativos respondem "o que é isto"; generativos, "como deveria parecer"