DALL·E 3
Schreibt eine lange Eingabe in eine detaillierte Beschreibung um und zeichnet dann das Bild
Der vollständige Artikel liegt auf Englisch vor; Titel und Zusammenfassung sind lokalisiert.
WAS ES IST
DALL·E 3 is OpenAI’s text-to-image model, released in October 2023. It folds prompt rewriting and image generation into one flow: the model first expands a short user prompt into a more detailed scene description, then generates the image from it, which improves adherence to long prompts and complex constraints. Training used automatic recaptioning to add fine-grained descriptions to images, narrowing the gap between images and their text labels. It is available through the API and ChatGPT.
Warum es wichtig ist
It made “understand the prompt first, then draw” a single pipeline, markedly improving adherence to long prompts and constraints, and turned conversational image generation into a routine ChatGPT capability.
Wichtige Eckdaten
- Resolution
- 1024×1024, 1792×1024, 1024×1792
- Prompt handling
- Automatic recaptioning during training
- Open weights
- No
- Availability
- API and ChatGPT
Fähigkeiten
Verwandte Konzepte
Diffusionsmodelle
Lerne tausend kleine Entrauschungsschritte, und du erzeugst ein Bild aus reinem Rauschen
Latente Diffusion und konditionale Steuerung
Diffusion nicht über Pixel, sondern in einem komprimierten semantischen Raum
Multimodale Generierung
Ein Modell, das sprechen, zeichnen, sich bewegen — und sogar die 3D-Welt modellieren lernt
Prompt-Engineering und Alignment
Ein Modell hilfreich, ehrlich und harmlos zu machen ist schwieriger, als es einfach größer zu machen
Vergleichbare Produkte
Midjourney
2022Ein Text-zu-Bild-Dienst, bekannt für seinen ästhetischen Stil
Stable Diffusion
2022Veröffentlichte Text-zu-Bild-Gewichte offen und klein genug für Consumer-GPUs
FLUX
2024Erzeugt hochauflösende Bilder mit einem Rectified-Flow-Transformer
Imagen
2022Erzeugt fotorealistische Bilder mit kaskadierter Diffusion und großem Text-Encoder
Firefly
2023Ein Werkzeug zur Bilderzeugung und -bearbeitung für Gestaltende
Seedream
2024Ein Text-zu-Bild-Modell mit nativer Hochauflösung und guter Textdarstellung