يُعرض النص الكامل باللغة الإنجليزية؛ وقد تمت ترجمة العنوان والملخص.
ما هو
DALL·E 3 is OpenAI’s text-to-image model, released in October 2023. It folds prompt rewriting and image generation into one flow: the model first expands a short user prompt into a more detailed scene description, then generates the image from it, which improves adherence to long prompts and complex constraints. Training used automatic recaptioning to add fine-grained descriptions to images, narrowing the gap between images and their text labels. It is available through the API and ChatGPT.
لماذا يستحق التذكّر
It made “understand the prompt first, then draw” a single pipeline, markedly improving adherence to long prompts and constraints, and turned conversational image generation into a routine ChatGPT capability.
المواصفات الأساسية
- Resolution
- 1024×1024, 1792×1024, 1024×1792
- Prompt handling
- Automatic recaptioning during training
- Open weights
- No
- Availability
- API and ChatGPT
القدرات المرتبطة
المفاهيم ذات الصلة
نماذج الانتشار
تعلّم ألف خطوة صغيرة لإزالة الضوضاء، فتستطيع بناء صورة من ضوضاء صافية
الانتشار في الفضاء الكامن والتحكم الشرطي
أجرِ الانتشار لا على البكسلات بل داخل فضاء دلالي مضغوط
التوليد متعدد الوسائط
نموذج واحد يتعلّم الكلام والرسم والحركة، بل ونمذجة العالم ثلاثي الأبعاد
هندسة الأوامر والمواءمة
جعل النموذج مفيداً وصادقاً وغير ضارّ أصعب من مجرد تكبيره
منتجات منافسة
Midjourney
2022خدمة نص إلى صورة تشتهر بذوقها الجمالي
Stable Diffusion
2022أطلق أوزان النص إلى صورة مفتوحة وبحجم يعمل على كروت الرسوميات الاستهلاكية
FLUX
2024يولّد صورًا عالية الدقة بمحوّل تدفّق مُقوَّم
Imagen
2022يولّد صورًا واقعية عبر الانتشار المتتالي ومُرمِّز نصي كبير
Firefly
2023أداة لتوليد الصور وتحريرها موجّهة للمبدعين
Seedream
2024نموذج نص إلى صورة بدقة عالية أصلية وقدرة جيدة على رسم النصوص