O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE É
Sora is a text-to-video model OpenAI first unveiled in February 2024. It tokenises video into spacetime patches and performs diffusion-style generation over that unified representation, which lets it accept different resolutions and durations. It accepts both text and image input for text-to-video and image-to-video. In its first demonstrations, clips ran up to about 60 seconds at 1080p, making it one of the few models to show minute-scale coherent video at the time.
Por que vale a pena lembrar
It brought minute-scale, shot-coherent video generation into public view for the first time, moving video generation beyond short clips toward consistency over longer stretches.
Especificações-chave
- Resolution
- Up to 1080p (first disclosure)
- Duration
- Up to about 60 seconds (first disclosure)
- Input
- Text, image
- Open weights
- No
Capacidades
Conceitos relacionados
Modelos de difusão
Aprenda mil pequenos passos de remoção de ruído e criará uma imagem a partir de ruído puro
Geração multimodal
Um único modelo que aprende a falar, desenhar, mover-se e até modelar o mundo 3D
Infraestrutura de treinamento e inferência
A memória decide o tamanho do modelo treinável; a comunicação, quanto tempo leva
Produtos semelhantes
Veo
2024Gera clipes de vídeo em 1080p com planos coerentes
Gen-3 Alpha
2024Um modelo texto para vídeo altamente controlável para cinema e publicidade
Kling
2024Um modelo de vídeo curto para texto-vídeo e imagem-vídeo
Hailuo
2024Um modelo de vídeo curto focado em seguir instruções e na linguagem de câmera
Stable Video Diffusion
2023Transforma uma imagem estática em um vídeo curto com um modelo de difusão
Dream Machine
2024Gera vídeos curtos com movimento a partir de texto ou de uma imagem
Seedance
2024Um modelo de geração de vídeo voltado à narrativa em vários planos
Synthesia
2019Escreva um texto e receba um vídeo com um avatar que fala