Texto a imagen
Convertir una frase en una imagen
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ SIGNIFICA ESTA CAPACIDAD
Maps a natural-language description directly to an image: text in, pixels out, with no annotation or reference image in between. Unlike image-to-image it has no input image at all, and unlike image editing it does not modify an existing picture but synthesises a new one from scratch.
Cómo se consigue técnicamente
The dominant route is latent diffusion: the prompt is encoded into a conditioning vector, injected into a denoising network through cross-attention, denoised step by step in a compressed latent space, and decoded to pixels. Conditioning was later extended by classifier-free guidance, which amplifies prompt adherence by contrasting the conditioned and unconditioned directions. Training uses vast image–text pairs, and DALL·E 3 coupled prompt rewriting with generation in one pipeline, markedly improving adherence to long prompts.
Productos representativos
7DALL·E 3
2023Reescribe un prompt largo en una descripción detallada y luego dibuja la imagen
Midjourney
2022Un servicio de texto a imagen conocido por su estilo estético
Stable Diffusion
2022Liberó los pesos de texto a imagen y los hizo caber en GPU de consumo
FLUX
2024Genera imágenes de alta resolución con un transformer de flujo rectificado
Imagen
2022Genera imágenes fotorrealistas con difusión en cascada y un gran codificador de texto
Seedream
2024Un modelo texto a imagen de alta resolución nativa y buen renderizado de texto
Firefly
2023Una herramienta de generación y edición de imágenes para creadores
Organizaciones relacionadas
Usos típicos
- Concept design and storyboards
- Marketing assets and illustration
- Pre-visualisation for games and film
- Personalised avatars and wallpapers
Cómo se evalúa
- FID
- Distance to the real image distribution; lower is better
- CLIP score
- Semantic agreement between image and prompt
- Human-preference Elo
- Preference ranking from pairwise comparison
Límites y dificultades
- Counting, precise spatial relations and ordering remain unreliable
- Letters inside the image are frequently garbled, especially in long strings
- Hands, limbs and object-contact points break down, often needing several resamples
Conceptos detrás
Modelos de difusión
Aprende mil pequeños pasos de eliminación de ruido y podrás crear una imagen desde ruido puro
Difusión latente y control condicional
Hacer difusión no sobre píxeles, sino dentro de un espacio semántico comprimido
Panorama de los modelos generativos
Los modelos discriminativos responden "qué es esto"; los generativos, "cómo debería verse"