Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО
Sora is a text-to-video model OpenAI first unveiled in February 2024. It tokenises video into spacetime patches and performs diffusion-style generation over that unified representation, which lets it accept different resolutions and durations. It accepts both text and image input for text-to-video and image-to-video. In its first demonstrations, clips ran up to about 60 seconds at 1080p, making it one of the few models to show minute-scale coherent video at the time.
Почему стоит запомнить
It brought minute-scale, shot-coherent video generation into public view for the first time, moving video generation beyond short clips toward consistency over longer stretches.
Ключевые характеристики
- Resolution
- Up to 1080p (first disclosure)
- Duration
- Up to about 60 seconds (first disclosure)
- Input
- Text, image
- Open weights
- No
Возможности
Связанные концепции
Диффузионные модели
Научитесь тысяче мелких шагов удаления шума — и соберёте изображение из чистого шума
Мультимодальная генерация
Одна модель учится говорить, рисовать, двигаться — и даже моделировать трёхмерный мир
Инфраструктура обучения и вывода
Память определяет размер модели, а коммуникации — время обучения; чистая вычислительная мощность редко бывает узким местом
Аналоги
Veo
2024Создаёт видеоклипы 1080p со связными планами
Gen-3 Alpha
2024Хорошо управляемая модель текст-видео для кино и рекламы
Kling
2024Модель коротких видео как из текста, так и из изображения
Hailuo
2024Модель коротких видео с упором на следование инструкциям и язык камеры
Stable Video Diffusion
2023Превращает один статичный кадр в короткое видео с помощью диффузии
Dream Machine
2024Создаёт короткие видео с движением из текста или изображения
Seedance
2024Модель генерации видео для многоракурсного повествования
Synthesia
2019Введите текст — получите видео с говорящим цифровым аватаром