Texto para vídeo
Transformar uma frase em um videoclipe
O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE ESTA CAPACIDADE SIGNIFICA
Takes a text description and outputs a video with a time dimension, where frames must stay coherent with one another. It adds a hard constraint over text-to-image: temporal consistency, so objects cannot deform or teleport between neighbouring frames. Unlike image-to-video there is no starting frame; everything is determined by the prompt.
Como é feita tecnicamente
The mainstream extends diffusion from two dimensions to three: a diffusion Transformer models space–time patches jointly so attention across frames constrains motion; another line uses a latent video autoencoder with spatio-temporal attention. Variable length and resolution are managed by generating and stitching in chunks. Synchronising audio and controlling camera language are recent extensions.
Produtos representativos
8Sora
2024Gera vídeo coerente de até cerca de um minuto a partir de uma descrição
Veo
2024Gera clipes de vídeo em 1080p com planos coerentes
Gen-3 Alpha
2024Um modelo texto para vídeo altamente controlável para cinema e publicidade
Kling
2024Um modelo de vídeo curto para texto-vídeo e imagem-vídeo
Hailuo
2024Um modelo de vídeo curto focado em seguir instruções e na linguagem de câmera
Seedance
2024Um modelo de geração de vídeo voltado à narrativa em vários planos
Dream Machine
2024Gera vídeos curtos com movimento a partir de texto ou de uma imagem
Synthesia
2019Escreva um texto e receba um vídeo com um avatar que fala
Organizações relacionadas
Usos típicos
- Fast spots for ads and short films
- Storyboards and animated pre-visualisation
- Short-form social media assets
- Shot drafts for games and virtual production
Como avaliar se funciona bem
- FVD
- Distance between generated and real video distributions; lower is better
- Motion consistency
- Whether position and shape stay continuous across frames
- Human preference
- Pairwise comparison of visual quality and prompt adherence
Limites e dificuldades
- Over long windows physics and causality break: objects vanish, merge or change identity
- Complex interactions and hand motion distort most, especially where several objects touch
- Clip length and resolution are compute-bound; beyond tens of seconds stitching shows seams
Conceitos por trás
Modelos de difusão
Aprenda mil pequenos passos de remoção de ruído e criará uma imagem a partir de ruído puro
Geração multimodal
Um único modelo que aprende a falar, desenhar, mover-se e até modelar o mundo 3D
Difusão latente e controle condicional
Fazer difusão não sobre pixels, mas dentro de um espaço semântico comprimido