Изображение в видео
Заставить статичное изображение двигаться
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО ЗА ВОЗМОЖНОСТЬ
Takes an image, optionally with a motion description, and outputs a clip that starts from it. The first frame is usually tightly constrained to the input, and later frames extrapolate motion and camera movement from there. Unlike text-to-video it has a definite visual starting point, which raises the bar for preserving subject identity and appearance.
Как это устроено
A common approach encodes the input as a condition, either pinning the first frame of the diffusion process or injecting it as a reference, then generates the following frames; another route extends keyframes with an image model and interpolates in between. Motion magnitude and camera control are set by explicit strength parameters or trajectory conditions, while physical plausibility is learned implicitly from motion priors in the data.
Примеры продуктов
8Stable Video Diffusion
2023Превращает один статичный кадр в короткое видео с помощью диффузии
Kling
2024Модель коротких видео как из текста, так и из изображения
Hailuo
2024Модель коротких видео с упором на следование инструкциям и язык камеры
Dream Machine
2024Создаёт короткие видео с движением из текста или изображения
Veo
2024Создаёт видеоклипы 1080p со связными планами
Gen-3 Alpha
2024Хорошо управляемая модель текст-видео для кино и рекламы
Seedance
2024Модель генерации видео для многоракурсного повествования
Sora
2024Создаёт связное видео длиной около минуты по текстовому описанию
Связанные организации
Типичное применение
- Animating photos and memory clips
- Product showcases and animated ad visuals
- Motion pre-vis from key art and storyboards
- Shot drafts for games and film
Как её оценивают
- FVD
- Distribution gap between generated and real video
- First-frame fidelity
- Agreement between the first frame and the input
- Human preference
- Pairwise judgement of motion naturalness and subject retention
Границы и трудности
- Identity drifts after the first frame, with faces and clothing changing first
- Large camera moves break background geometry: straight lines bend and buildings misalign
- Occlusion and parallax are often wrong, inverting front-back relations
Концепции в основе
Диффузионные модели
Научитесь тысяче мелких шагов удаления шума — и соберёте изображение из чистого шума
Диффузия в латентном пространстве и условное управление
Проводить диффузию не по пикселям, а внутри сжатого смыслового пространства
Мультимодальная генерация
Одна модель учится говорить, рисовать, двигаться — и даже моделировать трёхмерный мир