Stable Video Diffusion
Превращает один статичный кадр в короткое видео с помощью диффузии
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО
Stable Video Diffusion (SVD) is an image-to-video model Stability AI released in November 2023 with open weights. It frames image-to-video generation as latent-space diffusion: conditioned on a single still image, it produces a short clip with an adjustable amount of motion. The model generates 14 frames at 576×1024 resolution by default. It shipped as both an image-to-video model and a multi-view model, the latter synthesising views orbiting an object from a single image.
Почему стоит запомнить
It was one of the few image-to-video models to release open weights, letting “make a short video from one image” run locally or on self-hosted services and advancing open practice in image-to-video.
Ключевые характеристики
- Resolution
- 576×1024
- Default frames
- 14 frames
- Input
- Single image
- Open weights
- Yes
Возможности
Связанные концепции
Диффузия в латентном пространстве и условное управление
Проводить диффузию не по пикселям, а внутри сжатого смыслового пространства
Диффузионные модели
Научитесь тысяче мелких шагов удаления шума — и соберёте изображение из чистого шума
Мультимодальная генерация
Одна модель учится говорить, рисовать, двигаться — и даже моделировать трёхмерный мир
Аналоги
Sora
2024Создаёт связное видео длиной около минуты по текстовому описанию
Gen-3 Alpha
2024Хорошо управляемая модель текст-видео для кино и рекламы
Kling
2024Модель коротких видео как из текста, так и из изображения
Dream Machine
2024Создаёт короткие видео с движением из текста или изображения