DALL·E 3
Reescreve um prompt longo em descrição detalhada e depois desenha a imagem
O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE É
DALL·E 3 is OpenAI’s text-to-image model, released in October 2023. It folds prompt rewriting and image generation into one flow: the model first expands a short user prompt into a more detailed scene description, then generates the image from it, which improves adherence to long prompts and complex constraints. Training used automatic recaptioning to add fine-grained descriptions to images, narrowing the gap between images and their text labels. It is available through the API and ChatGPT.
Por que vale a pena lembrar
It made “understand the prompt first, then draw” a single pipeline, markedly improving adherence to long prompts and constraints, and turned conversational image generation into a routine ChatGPT capability.
Especificações-chave
- Resolution
- 1024×1024, 1792×1024, 1024×1792
- Prompt handling
- Automatic recaptioning during training
- Open weights
- No
- Availability
- API and ChatGPT
Capacidades
Conceitos relacionados
Modelos de difusão
Aprenda mil pequenos passos de remoção de ruído e criará uma imagem a partir de ruído puro
Difusão latente e controle condicional
Fazer difusão não sobre pixels, mas dentro de um espaço semântico comprimido
Geração multimodal
Um único modelo que aprende a falar, desenhar, mover-se e até modelar o mundo 3D
Engenharia de prompts e alinhamento
Tornar um modelo útil, honesto e inofensivo é mais difícil do que apenas torná-lo maior
Produtos semelhantes
Midjourney
2022Um serviço de texto para imagem conhecido pelo estilo estético
Stable Diffusion
2022Abriu os pesos de texto para imagem e os tornou executáveis em GPUs de consumo
FLUX
2024Gera imagens de alta resolução com um transformer de fluxo retificado
Imagen
2022Gera imagens fotorrealistas com difusão em cascata e um grande codificador de texto
Firefly
2023Uma ferramenta de geração e edição de imagens para criadores
Seedream
2024Um modelo texto para imagem de alta resolução nativa e bom render de texto