El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ ES
Veo is a text-to-video model Google DeepMind announced in May 2024. It accepts text or image input, generates 1080p video longer than a minute, and supports several cinematic styles and camera controls. Veo is also used in product settings such as YouTube’s short-form tools. Its weights are not open.
Por qué merece la pena recordarlo
It put high resolution, longer duration and controllable camera work into a single video model and fed it directly into Google’s product line, making it a major entry in the 2024 text-to-video race.
Especificaciones clave
- Resolution
- 1080p
- Duration
- Over 60 seconds (first disclosure)
- Input
- Text, image
- Open weights
- No
Capacidades
Conceptos relacionados
Modelos de difusión
Aprende mil pequeños pasos de eliminación de ruido y podrás crear una imagen desde ruido puro
Generación multimodal
Un mismo modelo que aprende a hablar, dibujar, moverse e incluso modelar el mundo 3D
Infraestructura de entrenamiento e inferencia
La memoria decide qué tan grande es el modelo que puedes entrenar; la comunicación, cuánto tarda
Productos similares
Sora
2024Genera vídeo coherente de hasta un minuto a partir de una descripción
Gen-3 Alpha
2024Un modelo texto a vídeo muy controlable para cine y publicidad
Kling
2024Un modelo de vídeo corto para texto a vídeo y imagen a vídeo
Dream Machine
2024Genera vídeos cortos con movimiento a partir de texto o una imagen
Seedance
2024Un modelo de generación de vídeo orientado a narrativas de varios planos
Synthesia
2019Escribe texto y obtén un vídeo con un avatar que habla