文生视频
用一句描述生成一段短片
视频入门 #23
输入文本视频
这项能力指什么
输入文字描述,输出一段具有时间维度的视频,画面要在多帧之间保持连贯。它比文生图多了一项硬约束:时间一致性,相邻帧里的物体不能凭空变形或换位。与「图生视频」的区别是没有起始画面,一切由文字决定。
技术上如何做到
主流把扩散从二维扩到三维:在扩散 Transformer 里对时空图块统一建模,让注意力跨越帧去约束运动;也有的走潜空间视频自编码器加时空注意力。可变时长与分辨率靠分块生成与拼接控制。音画同步与镜头语言的进一步控制是近年的扩展方向。
代表产品
8Sora
2024OpenAI
从一句描述生成最长约一分钟的连贯视频
模型 闭源
文本图像视频
Veo
2024Google DeepMind
生成 1080p、镜头连贯的视频片段
模型 闭源
文本图像视频
Gen-3 Alpha
2024Runway
面向影视与广告的高可控文生视频模型
模型 闭源
文本图像视频
Kling
2024Kuaishou (Kling)
可文生视频也可图生视频的短视频模型
模型 闭源
文本图像视频
Hailuo
2024MiniMax
主打指令遵循与镜头语言的短视频模型
模型 闭源
文本图像视频
Seedance
2024ByteDance (Seed)
面向多镜头叙事的视频生成模型
模型 闭源
文本图像视频
Dream Machine
2024Luma AI
从文字或图片生成带运动的短视频
模型 闭源
文本图像视频
Synthesia
2019Synthesia
输入文字即可生成数字人口播视频
应用 闭源
文本视频
相关机构
典型用途
- 广告与短片的快速样片
- 分镜与动态预演
- 社交媒体短视频素材
- 游戏与虚拟制作的镜头草稿
怎么评价它好不好
- FVD
- 视频分布与真实视频的差距,越低越好
- 运动一致性
- 物体在多帧间的位置与形态是否连续
- 人工偏好
- 成对比较画面质量与提示遵循度
边界与难点
- 长时间窗口内物理与因果不一致,物体中途消失、融合或改变身份
- 复杂交互与手部动作最容易失真,多物体接触场景尤其明显
- 片长与分辨率受算力限制,几十秒以上往往需要拼接并显露出接缝