Stable Diffusion
أطلق أوزان النص إلى صورة مفتوحة وبحجم يعمل على كروت الرسوميات الاستهلاكية
يُعرض النص الكامل باللغة الإنجليزية؛ وقد تمت ترجمة العنوان والملخص.
ما هو
Stable Diffusion is an open-source text-to-image model that Stability AI released in August 2022. It runs the diffusion process in the latent space of a pretrained autoencoder, sharply cutting computation so the model can run on consumer GPUs. Text is turned into conditioning vectors by a CLIP text encoder and injected into the denoising network through cross-attention. The first 1.x version natively outputs 512×512, with a U-Net of roughly 860 million parameters and weights released under an open licence.
لماذا يستحق التذكّر
By open-sourcing text-to-image weights and making them runnable on consumer GPUs, it directly spawned the whole open-source image ecosystem of fine-tunes, plugins and local generation, marking the point where generative imagery reached a broad audience.
المواصفات الأساسية
- Native resolution
- 512×512 (1.x)
- U-Net parameters
- About 860M
- Architecture
- Latent diffusion + CLIP text encoder
- Open weights
- Yes
- Released
- 2022-08
القدرات المرتبطة
المفاهيم ذات الصلة
الانتشار في الفضاء الكامن والتحكم الشرطي
أجرِ الانتشار لا على البكسلات بل داخل فضاء دلالي مضغوط
نماذج الانتشار
تعلّم ألف خطوة صغيرة لإزالة الضوضاء، فتستطيع بناء صورة من ضوضاء صافية
المرمّزات الذاتية والمرمّزات الذاتية التباينية
اضغط المعلومات عبر عنق زجاجة ثم أعِد إنماءها
التوليد متعدد الوسائط
نموذج واحد يتعلّم الكلام والرسم والحركة، بل ونمذجة العالم ثلاثي الأبعاد
منتجات منافسة
Midjourney
2022خدمة نص إلى صورة تشتهر بذوقها الجمالي
DALL·E 3
2023يعيد صياغة الطلب الطويل إلى وصف مفصّل ثم يرسم الصورة
FLUX
2024يولّد صورًا عالية الدقة بمحوّل تدفّق مُقوَّم
Imagen
2022يولّد صورًا واقعية عبر الانتشار المتتالي ومُرمِّز نصي كبير
Firefly
2023أداة لتوليد الصور وتحريرها موجّهة للمبدعين
Seedream
2024نموذج نص إلى صورة بدقة عالية أصلية وقدرة جيدة على رسم النصوص