Toàn văn của trang này được trình bày bằng tiếng Anh; tiêu đề và phần dẫn đã được bản địa hóa.
NÓ LÀ GÌ
DALL·E 3 is OpenAI’s text-to-image model, released in October 2023. It folds prompt rewriting and image generation into one flow: the model first expands a short user prompt into a more detailed scene description, then generates the image from it, which improves adherence to long prompts and complex constraints. Training used automatic recaptioning to add fine-grained descriptions to images, narrowing the gap between images and their text labels. It is available through the API and ChatGPT.
Vì sao đáng ghi nhớ
It made “understand the prompt first, then draw” a single pipeline, markedly improving adherence to long prompts and constraints, and turned conversational image generation into a routine ChatGPT capability.
Thông số chính
- Resolution
- 1024×1024, 1792×1024, 1024×1792
- Prompt handling
- Automatic recaptioning during training
- Open weights
- No
- Availability
- API and ChatGPT
Năng lực liên quan
Khái niệm liên quan
Mô hình khuếch tán
Học ngàn bước khử nhiễu nhỏ, bạn tạo được ảnh từ nhiễu thuần
Khuếch tán trong không gian ẩn và điều khiển có điều kiện
Khuếch tán không trên điểm ảnh, mà trong một không gian ngữ nghĩa đã nén
Sinh đa phương thức
Một mô hình học nói, vẽ, chuyển động — thậm chí mô hình hóa thế giới ba chiều
Kỹ thuật prompt và căn chỉnh
Làm cho mô hình hữu ích, trung thực và vô hại khó hơn việc chỉ phóng to nó
Sản phẩm cùng loại
Midjourney
2022Dịch vụ tạo ảnh từ văn bản nổi bật về phong cách thẩm mỹ
Stable Diffusion
2022Mở công khai trọng số tạo ảnh từ văn bản, đủ nhẹ để chạy trên GPU phổ thông
FLUX
2024Tạo ảnh độ phân giải cao bằng transformer luồng chỉnh lưu
Imagen
2022Tạo ảnh chân thực bằng khuếch tán theo tầng và bộ mã hóa văn bản lớn
Firefly
2023Công cụ tạo và chỉnh sửa ảnh cho người sáng tạo
Seedream
2024Mô hình văn bản thành ảnh có độ phân giải cao gốc và hiển thị chữ tốt