DALL·E 3
Сначала переписывает длинный запрос в подробное описание, затем рисует изображение
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО
DALL·E 3 is OpenAI’s text-to-image model, released in October 2023. It folds prompt rewriting and image generation into one flow: the model first expands a short user prompt into a more detailed scene description, then generates the image from it, which improves adherence to long prompts and complex constraints. Training used automatic recaptioning to add fine-grained descriptions to images, narrowing the gap between images and their text labels. It is available through the API and ChatGPT.
Почему стоит запомнить
It made “understand the prompt first, then draw” a single pipeline, markedly improving adherence to long prompts and constraints, and turned conversational image generation into a routine ChatGPT capability.
Ключевые характеристики
- Resolution
- 1024×1024, 1792×1024, 1024×1792
- Prompt handling
- Automatic recaptioning during training
- Open weights
- No
- Availability
- API and ChatGPT
Возможности
Связанные концепции
Диффузионные модели
Научитесь тысяче мелких шагов удаления шума — и соберёте изображение из чистого шума
Диффузия в латентном пространстве и условное управление
Проводить диффузию не по пикселям, а внутри сжатого смыслового пространства
Мультимодальная генерация
Одна модель учится говорить, рисовать, двигаться — и даже моделировать трёхмерный мир
Промптинг и выравнивание
Сделать модель полезной, честной и безопасной труднее, чем просто увеличить её
Аналоги
Midjourney
2022Сервис генерации изображений, известный своим эстетическим стилем
Stable Diffusion
2022Открыла веса генерации изображений и сделала их посильными для потребительских видеокарт
FLUX
2024Создаёт изображения высокого разрешения с помощью трансформера rectified flow
Imagen
2022Создаёт фотореалистичные изображения каскадной диффузией и крупным текстовым энкодером
Firefly
2023Инструмент генерации и редактирования изображений для авторов
Seedream
2024Модель текст-изображение с нативным высоким разрешением и хорошей отрисовкой текста