输入文本图像视频
它是什么
Veo 是 Google DeepMind 于 2024 年 5 月公布的文生视频模型。它接受文本或图像输入,可生成 1080p、片长超过一分钟的视频,并支持多种电影化的镜头风格与运镜控制。Veo 同时用于 YouTube 的短视频工具等产品场景。它没有开放权重。
为什么值得记住
它把高分辨率、较长时长与可控运镜放进同一个视频模型,并直接接入 Google 的产品线,是 2024 年文生视频竞争中的重要一支。
关键规格
- 分辨率
- 1080p
- 时长
- 超过 60 秒(首次公布)
- 输入
- 文本、图像
- 开放权重
- 否
所属能力
相关概念
同类产品
Sora
2024OpenAI
从一句描述生成最长约一分钟的连贯视频
模型 闭源
文本图像视频
Gen-3 Alpha
2024Runway
面向影视与广告的高可控文生视频模型
模型 闭源
文本图像视频
Kling
2024Kuaishou (Kling)
可文生视频也可图生视频的短视频模型
模型 闭源
文本图像视频
Dream Machine
2024Luma AI
从文字或图片生成带运动的短视频
模型 闭源
文本图像视频
Seedance
2024ByteDance (Seed)
面向多镜头叙事的视频生成模型
模型 闭源
文本图像视频
Synthesia
2019Synthesia
输入文字即可生成数字人口播视频
应用 闭源
文本视频