يُعرض النص الكامل باللغة الإنجليزية؛ وقد تمت ترجمة العنوان والملخص.
ما هو
Sora is a text-to-video model OpenAI first unveiled in February 2024. It tokenises video into spacetime patches and performs diffusion-style generation over that unified representation, which lets it accept different resolutions and durations. It accepts both text and image input for text-to-video and image-to-video. In its first demonstrations, clips ran up to about 60 seconds at 1080p, making it one of the few models to show minute-scale coherent video at the time.
لماذا يستحق التذكّر
It brought minute-scale, shot-coherent video generation into public view for the first time, moving video generation beyond short clips toward consistency over longer stretches.
المواصفات الأساسية
- Resolution
- Up to 1080p (first disclosure)
- Duration
- Up to about 60 seconds (first disclosure)
- Input
- Text, image
- Open weights
- No
القدرات المرتبطة
المفاهيم ذات الصلة
نماذج الانتشار
تعلّم ألف خطوة صغيرة لإزالة الضوضاء، فتستطيع بناء صورة من ضوضاء صافية
التوليد متعدد الوسائط
نموذج واحد يتعلّم الكلام والرسم والحركة، بل ونمذجة العالم ثلاثي الأبعاد
البنية التحتية للتدريب والاستدلال
تحدد الذاكرة حجم النموذج القابل للتدريب، ويحدد الاتصال المدة التي يستغرقها — ونادرًا ما تكون الحوسبة الخام هي عنق الزجاجة
منتجات منافسة
Veo
2024يولّد مقاطع فيديو بدقة 1080p بمشاهد متماسكة
Gen-3 Alpha
2024نموذج نص إلى فيديو عالي التحكم لأغراض السينما والإعلان
Kling
2024نموذج فيديو قصير يدعم النص إلى فيديو والصورة إلى فيديو
Hailuo
2024نموذج فيديو قصير يركّز على اتباع التعليمات ولغة الكاميرا
Stable Video Diffusion
2023يحوّل صورة ثابتة واحدة إلى فيديو قصير بنموذج انتشار
Dream Machine
2024يولّد فيديوهات قصيرة بحركة من نص أو صورة
Seedance
2024نموذج توليد فيديو موجّه لسرد متعدد المشاهد
Synthesia
2019اكتب نصًا فتحصل على فيديو بشخصية رقمية تتحدث