El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ ES
Sora is a text-to-video model OpenAI first unveiled in February 2024. It tokenises video into spacetime patches and performs diffusion-style generation over that unified representation, which lets it accept different resolutions and durations. It accepts both text and image input for text-to-video and image-to-video. In its first demonstrations, clips ran up to about 60 seconds at 1080p, making it one of the few models to show minute-scale coherent video at the time.
Por qué merece la pena recordarlo
It brought minute-scale, shot-coherent video generation into public view for the first time, moving video generation beyond short clips toward consistency over longer stretches.
Especificaciones clave
- Resolution
- Up to 1080p (first disclosure)
- Duration
- Up to about 60 seconds (first disclosure)
- Input
- Text, image
- Open weights
- No
Capacidades
Conceptos relacionados
Modelos de difusión
Aprende mil pequeños pasos de eliminación de ruido y podrás crear una imagen desde ruido puro
Generación multimodal
Un mismo modelo que aprende a hablar, dibujar, moverse e incluso modelar el mundo 3D
Infraestructura de entrenamiento e inferencia
La memoria decide qué tan grande es el modelo que puedes entrenar; la comunicación, cuánto tarda
Productos similares
Veo
2024Genera clips de vídeo en 1080p con planos coherentes
Gen-3 Alpha
2024Un modelo texto a vídeo muy controlable para cine y publicidad
Kling
2024Un modelo de vídeo corto para texto a vídeo y imagen a vídeo
Hailuo
2024Un modelo de vídeo corto centrado en seguir instrucciones y el lenguaje de cámara
Stable Video Diffusion
2023Convierte una imagen fija en un vídeo corto con un modelo de difusión
Dream Machine
2024Genera vídeos cortos con movimiento a partir de texto o una imagen
Seedance
2024Un modelo de generación de vídeo orientado a narrativas de varios planos
Synthesia
2019Escribe texto y obtén un vídeo con un avatar que habla