跳到正文
AI 图鉴

文生视频

用一句描述生成一段短片

视频入门 #23
输入文本视频

这项能力指什么

输入文字描述,输出一段具有时间维度的视频,画面要在多帧之间保持连贯。它比文生图多了一项硬约束:时间一致性,相邻帧里的物体不能凭空变形或换位。与「图生视频」的区别是没有起始画面,一切由文字决定。

技术上如何做到

主流把扩散从二维扩到三维:在扩散 Transformer 里对时空图块统一建模,让注意力跨越帧去约束运动;也有的走潜空间视频自编码器加时空注意力。可变时长与分辨率靠分块生成与拼接控制。音画同步与镜头语言的进一步控制是近年的扩展方向。

代表产品

8

相关机构

典型用途

  • 广告与短片的快速样片
  • 分镜与动态预演
  • 社交媒体短视频素材
  • 游戏与虚拟制作的镜头草稿

怎么评价它好不好

FVD
视频分布与真实视频的差距,越低越好
运动一致性
物体在多帧间的位置与形态是否连续
人工偏好
成对比较画面质量与提示遵循度

边界与难点

  • 长时间窗口内物理与因果不一致,物体中途消失、融合或改变身份
  • 复杂交互与手部动作最容易失真,多物体接触场景尤其明显
  • 片长与分辨率受算力限制,几十秒以上往往需要拼接并显露出接缝

背后的概念