DALL·E 3
Réécrit une longue consigne en description détaillée, puis dessine l’image
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE C'EST
DALL·E 3 is OpenAI’s text-to-image model, released in October 2023. It folds prompt rewriting and image generation into one flow: the model first expands a short user prompt into a more detailed scene description, then generates the image from it, which improves adherence to long prompts and complex constraints. Training used automatic recaptioning to add fine-grained descriptions to images, narrowing the gap between images and their text labels. It is available through the API and ChatGPT.
Pourquoi il compte
It made “understand the prompt first, then draw” a single pipeline, markedly improving adherence to long prompts and constraints, and turned conversational image generation into a routine ChatGPT capability.
Caractéristiques clés
- Resolution
- 1024×1024, 1792×1024, 1024×1792
- Prompt handling
- Automatic recaptioning during training
- Open weights
- No
- Availability
- API and ChatGPT
Capacités
Concepts liés
Modèles de diffusion
Apprenez mille petits pas de débruitage et vous créerez une image à partir de bruit pur
Diffusion latente et contrôle conditionnel
Diffuser non pas sur les pixels, mais dans un espace sémantique comprimé
Génération multimodale
Un seul modèle qui apprend à parler, dessiner, bouger — et même à modéliser le monde 3D
Ingénierie des prompts et alignement
Rendre un modèle utile, honnête et inoffensif est plus difficile que de simplement l’agrandir
Produits comparables
Midjourney
2022Un service texte-image réputé pour son style esthétique
Stable Diffusion
2022A libéré les poids texte-image et les a rendus exécutables sur des GPU grand public
FLUX
2024Génère des images haute résolution avec un transformer à flux rectifié
Imagen
2022Génère des images photoréalistes par diffusion en cascade et un grand encodeur de texte
Firefly
2023Un outil de génération et d’édition d’images pour les créateurs
Seedream
2024Un modèle texte-image à haute résolution native et bon rendu du texte