Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE C'EST
Sora is a text-to-video model OpenAI first unveiled in February 2024. It tokenises video into spacetime patches and performs diffusion-style generation over that unified representation, which lets it accept different resolutions and durations. It accepts both text and image input for text-to-video and image-to-video. In its first demonstrations, clips ran up to about 60 seconds at 1080p, making it one of the few models to show minute-scale coherent video at the time.
Pourquoi il compte
It brought minute-scale, shot-coherent video generation into public view for the first time, moving video generation beyond short clips toward consistency over longer stretches.
Caractéristiques clés
- Resolution
- Up to 1080p (first disclosure)
- Duration
- Up to about 60 seconds (first disclosure)
- Input
- Text, image
- Open weights
- No
Capacités
Concepts liés
Modèles de diffusion
Apprenez mille petits pas de débruitage et vous créerez une image à partir de bruit pur
Génération multimodale
Un seul modèle qui apprend à parler, dessiner, bouger — et même à modéliser le monde 3D
Infrastructure d’entraînement et d’inférence
La mémoire décide de la taille du modèle entraînable, la communication de la durée — le calcul brut est rarement le goulot
Produits comparables
Veo
2024Génère des clips vidéo 1080p aux plans cohérents
Gen-3 Alpha
2024Un modèle texte-vidéo très contrôlable pour le cinéma et la publicité
Kling
2024Un modèle de vidéo courte pour texte-vidéo et image-vidéo
Hailuo
2024Un modèle de vidéo courte axé sur le suivi d’instructions et le langage caméra
Stable Video Diffusion
2023Transforme une image fixe en courte vidéo avec un modèle de diffusion
Dream Machine
2024Génère de courtes vidéos animées à partir de texte ou d’une image
Seedance
2024Un modèle de génération vidéo visant le récit multi-plans
Synthesia
2019Saisissez un texte, obtenez une vidéo avec un avatar qui parle