Texto a vídeo
Convertir una frase en un videoclip
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ SIGNIFICA ESTA CAPACIDAD
Takes a text description and outputs a video with a time dimension, where frames must stay coherent with one another. It adds a hard constraint over text-to-image: temporal consistency, so objects cannot deform or teleport between neighbouring frames. Unlike image-to-video there is no starting frame; everything is determined by the prompt.
Cómo se consigue técnicamente
The mainstream extends diffusion from two dimensions to three: a diffusion Transformer models space–time patches jointly so attention across frames constrains motion; another line uses a latent video autoencoder with spatio-temporal attention. Variable length and resolution are managed by generating and stitching in chunks. Synchronising audio and controlling camera language are recent extensions.
Productos representativos
8Sora
2024Genera vídeo coherente de hasta un minuto a partir de una descripción
Veo
2024Genera clips de vídeo en 1080p con planos coherentes
Gen-3 Alpha
2024Un modelo texto a vídeo muy controlable para cine y publicidad
Kling
2024Un modelo de vídeo corto para texto a vídeo y imagen a vídeo
Hailuo
2024Un modelo de vídeo corto centrado en seguir instrucciones y el lenguaje de cámara
Seedance
2024Un modelo de generación de vídeo orientado a narrativas de varios planos
Dream Machine
2024Genera vídeos cortos con movimiento a partir de texto o una imagen
Synthesia
2019Escribe texto y obtén un vídeo con un avatar que habla
Organizaciones relacionadas
Usos típicos
- Fast spots for ads and short films
- Storyboards and animated pre-visualisation
- Short-form social media assets
- Shot drafts for games and virtual production
Cómo se evalúa
- FVD
- Distance between generated and real video distributions; lower is better
- Motion consistency
- Whether position and shape stay continuous across frames
- Human preference
- Pairwise comparison of visual quality and prompt adherence
Límites y dificultades
- Over long windows physics and causality break: objects vanish, merge or change identity
- Complex interactions and hand motion distort most, especially where several objects touch
- Clip length and resolution are compute-bound; beyond tens of seconds stitching shows seams
Conceptos detrás
Modelos de difusión
Aprende mil pequeños pasos de eliminación de ruido y podrás crear una imagen desde ruido puro
Generación multimodal
Un mismo modelo que aprende a hablar, dibujar, moverse e incluso modelar el mundo 3D
Difusión latente y control condicional
Hacer difusión no sobre píxeles, sino dentro de un espacio semántico comprimido