图生视频
让一张静态图动起来
视频入门 #24
输入图像视频
这项能力指什么
输入一张图像(可附加运动描述),输出从这张图出发的一段视频。首帧通常被强约束为输入图,之后的帧在其基础上推演运动与镜头变化。它与「文生视频」的区别是有确定的视觉起点,因此对主体的身份与外观保持要求更高。
技术上如何做到
常见做法是把输入图编码为条件,加到扩散模型的首帧或作为参考注入,再生成后续帧;也有先用图像模型延展关键帧、再插帧补全的路线。运动幅度与镜头控制通过显式的运动强度参数或轨迹条件来指定,物理规律则靠数据中的运动先验隐式学到。
代表产品
8Stable Video Diffusion
2023Stability AI
用扩散模型把一张静态图变成一段短视频
模型 开放权重
图像视频
Kling
2024Kuaishou (Kling)
可文生视频也可图生视频的短视频模型
模型 闭源
文本图像视频
Hailuo
2024MiniMax
主打指令遵循与镜头语言的短视频模型
模型 闭源
文本图像视频
Dream Machine
2024Luma AI
从文字或图片生成带运动的短视频
模型 闭源
文本图像视频
Veo
2024Google DeepMind
生成 1080p、镜头连贯的视频片段
模型 闭源
文本图像视频
Gen-3 Alpha
2024Runway
面向影视与广告的高可控文生视频模型
模型 闭源
文本图像视频
Seedance
2024ByteDance (Seed)
面向多镜头叙事的视频生成模型
模型 闭源
文本图像视频
Sora
2024OpenAI
从一句描述生成最长约一分钟的连贯视频
模型 闭源
文本图像视频
相关机构
典型用途
- 照片的动态化与回忆短片
- 产品展示与广告动态图
- 原画与分镜的动态预演
- 游戏与影视的镜头草稿
怎么评价它好不好
- FVD
- 生成视频与真实视频的分布差距
- 首帧保真度
- 首帧与输入图的一致程度
- 人工偏好
- 对运动自然度与主体保持的成对比较
边界与难点
- 首帧之后主体身份会漂移,人脸与服装细节最先变化
- 大幅度运镜会让背景几何崩坏,直线变弯、建筑错位
- 遮挡与视差关系常被算错,前景后景的前后关系会颠倒