Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE C'EST
Veo is a text-to-video model Google DeepMind announced in May 2024. It accepts text or image input, generates 1080p video longer than a minute, and supports several cinematic styles and camera controls. Veo is also used in product settings such as YouTube’s short-form tools. Its weights are not open.
Pourquoi il compte
It put high resolution, longer duration and controllable camera work into a single video model and fed it directly into Google’s product line, making it a major entry in the 2024 text-to-video race.
Caractéristiques clés
- Resolution
- 1080p
- Duration
- Over 60 seconds (first disclosure)
- Input
- Text, image
- Open weights
- No
Capacités
Concepts liés
Modèles de diffusion
Apprenez mille petits pas de débruitage et vous créerez une image à partir de bruit pur
Génération multimodale
Un seul modèle qui apprend à parler, dessiner, bouger — et même à modéliser le monde 3D
Infrastructure d’entraînement et d’inférence
La mémoire décide de la taille du modèle entraînable, la communication de la durée — le calcul brut est rarement le goulot
Produits comparables
Sora
2024Génère une vidéo cohérente d’environ une minute à partir d’une description
Gen-3 Alpha
2024Un modèle texte-vidéo très contrôlable pour le cinéma et la publicité
Kling
2024Un modèle de vidéo courte pour texte-vidéo et image-vidéo
Dream Machine
2024Génère de courtes vidéos animées à partir de texte ou d’une image
Seedance
2024Un modèle de génération vidéo visant le récit multi-plans
Synthesia
2019Saisissez un texte, obtenez une vidéo avec un avatar qui parle