O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE É
Veo is a text-to-video model Google DeepMind announced in May 2024. It accepts text or image input, generates 1080p video longer than a minute, and supports several cinematic styles and camera controls. Veo is also used in product settings such as YouTube’s short-form tools. Its weights are not open.
Por que vale a pena lembrar
It put high resolution, longer duration and controllable camera work into a single video model and fed it directly into Google’s product line, making it a major entry in the 2024 text-to-video race.
Especificações-chave
- Resolution
- 1080p
- Duration
- Over 60 seconds (first disclosure)
- Input
- Text, image
- Open weights
- No
Capacidades
Conceitos relacionados
Modelos de difusão
Aprenda mil pequenos passos de remoção de ruído e criará uma imagem a partir de ruído puro
Geração multimodal
Um único modelo que aprende a falar, desenhar, mover-se e até modelar o mundo 3D
Infraestrutura de treinamento e inferência
A memória decide o tamanho do modelo treinável; a comunicação, quanto tempo leva
Produtos semelhantes
Sora
2024Gera vídeo coerente de até cerca de um minuto a partir de uma descrição
Gen-3 Alpha
2024Um modelo texto para vídeo altamente controlável para cinema e publicidade
Kling
2024Um modelo de vídeo curto para texto-vídeo e imagem-vídeo
Dream Machine
2024Gera vídeos curtos com movimento a partir de texto ou de uma imagem
Seedance
2024Um modelo de geração de vídeo voltado à narrativa em vários planos
Synthesia
2019Escreva um texto e receba um vídeo com um avatar que fala