跳到正文
AI 图鉴

图生视频

让一张静态图动起来

视频入门 #24
输入图像视频

这项能力指什么

输入一张图像(可附加运动描述),输出从这张图出发的一段视频。首帧通常被强约束为输入图,之后的帧在其基础上推演运动与镜头变化。它与「文生视频」的区别是有确定的视觉起点,因此对主体的身份与外观保持要求更高。

技术上如何做到

常见做法是把输入图编码为条件,加到扩散模型的首帧或作为参考注入,再生成后续帧;也有先用图像模型延展关键帧、再插帧补全的路线。运动幅度与镜头控制通过显式的运动强度参数或轨迹条件来指定,物理规律则靠数据中的运动先验隐式学到。

代表产品

8

相关机构

典型用途

  • 照片的动态化与回忆短片
  • 产品展示与广告动态图
  • 原画与分镜的动态预演
  • 游戏与影视的镜头草稿

怎么评价它好不好

FVD
生成视频与真实视频的分布差距
首帧保真度
首帧与输入图的一致程度
人工偏好
对运动自然度与主体保持的成对比较

边界与难点

  • 首帧之后主体身份会漂移,人脸与服装细节最先变化
  • 大幅度运镜会让背景几何崩坏,直线变弯、建筑错位
  • 遮挡与视差关系常被算错,前景后景的前后关系会颠倒

背后的概念