输入文本图像视频
它是什么
Sora 是 OpenAI 于 2024 年 2 月首次公布的文生视频模型。它把视频拆成时空图块(spacetime patches),在统一的表示上做扩散式生成,因而可以接受不同分辨率与时长。它同时支持文本与图像输入,用于文生视频与图生视频。首次公布时演示的片段长度最长约 60 秒、分辨率到 1080p,是当时少数把「一分钟级连贯视频」公开展示的模型。
为什么值得记住
它让「一分钟级、镜头连贯的视频生成」第一次进入公众视野,把视频生成从短片拼接推进到较长时间尺度上的一致场景。
关键规格
- 分辨率
- 最高 1080p(首次公布)
- 时长
- 最长约 60 秒(首次公布)
- 输入
- 文本、图像
- 开放权重
- 否
所属能力
相关概念
同类产品
Veo
2024Google DeepMind
生成 1080p、镜头连贯的视频片段
模型 闭源
文本图像视频
Gen-3 Alpha
2024Runway
面向影视与广告的高可控文生视频模型
模型 闭源
文本图像视频
Kling
2024Kuaishou (Kling)
可文生视频也可图生视频的短视频模型
模型 闭源
文本图像视频
Hailuo
2024MiniMax
主打指令遵循与镜头语言的短视频模型
模型 闭源
文本图像视频
Stable Video Diffusion
2023Stability AI
用扩散模型把一张静态图变成一段短视频
模型 开放权重
图像视频
Dream Machine
2024Luma AI
从文字或图片生成带运动的短视频
模型 闭源
文本图像视频
Seedance
2024ByteDance (Seed)
面向多镜头叙事的视频生成模型
模型 闭源
文本图像视频
Synthesia
2019Synthesia
输入文字即可生成数字人口播视频
应用 闭源
文本视频