يُعرض النص الكامل باللغة الإنجليزية؛ وقد تمت ترجمة العنوان والملخص.
ما هو
Veo is a text-to-video model Google DeepMind announced in May 2024. It accepts text or image input, generates 1080p video longer than a minute, and supports several cinematic styles and camera controls. Veo is also used in product settings such as YouTube’s short-form tools. Its weights are not open.
لماذا يستحق التذكّر
It put high resolution, longer duration and controllable camera work into a single video model and fed it directly into Google’s product line, making it a major entry in the 2024 text-to-video race.
المواصفات الأساسية
- Resolution
- 1080p
- Duration
- Over 60 seconds (first disclosure)
- Input
- Text, image
- Open weights
- No
القدرات المرتبطة
المفاهيم ذات الصلة
نماذج الانتشار
تعلّم ألف خطوة صغيرة لإزالة الضوضاء، فتستطيع بناء صورة من ضوضاء صافية
التوليد متعدد الوسائط
نموذج واحد يتعلّم الكلام والرسم والحركة، بل ونمذجة العالم ثلاثي الأبعاد
البنية التحتية للتدريب والاستدلال
تحدد الذاكرة حجم النموذج القابل للتدريب، ويحدد الاتصال المدة التي يستغرقها — ونادرًا ما تكون الحوسبة الخام هي عنق الزجاجة
منتجات منافسة
Sora
2024يولّد فيديو متماسكًا يصل إلى نحو دقيقة من وصف نصي
Gen-3 Alpha
2024نموذج نص إلى فيديو عالي التحكم لأغراض السينما والإعلان
Kling
2024نموذج فيديو قصير يدعم النص إلى فيديو والصورة إلى فيديو
Dream Machine
2024يولّد فيديوهات قصيرة بحركة من نص أو صورة
Seedance
2024نموذج توليد فيديو موجّه لسرد متعدد المشاهد
Synthesia
2019اكتب نصًا فتحصل على فيديو بشخصية رقمية تتحدث