跳到正文
AI 图鉴

视频理解

看懂一段视频里发生了什么

视频进阶 #25
输入视频文本文本

这项能力指什么

输入一段视频(可附带问题),输出对内容、事件与时间线的描述或回答,如「三分钟后发生了什么」「这个动作做对了吗」。它在图像理解之上增加了时间维度,要能区分类似画面中先后顺序的不同事件。输入常按帧采样后压缩送入模型。

技术上如何做到

做法是先按固定或自适应策略抽帧,用视觉编码器把每帧变成 token,再把帧间顺序与时间戳一并送入多模态 Transformer,由语言模型生成文字输出。长视频靠层次化摘要、关键帧挑选或记忆机制来控制 token 预算。要精确定位时间点,则会训练专门的时序定位头或让模型输出时间区间。

代表产品

5

相关机构

典型用途

  • 监控与安防的事件检索
  • 体育与健身的动作点评
  • 课程与会议的视频概览
  • 内容审核与违规片段定位

怎么评价它好不好

视频问答准确率
在带标注问题上答对的比例
时序定位 mIoU
预测时间区间与真值区间的平均交并比
视频描述 CIDEr
描述与参考答案的语义匹配度

边界与难点

  • 抽帧采样会丢掉中段细节,长视频里发生一次的事件最容易被漏掉
  • 精细时序判断(谁在何时先做了什么)容易含糊,先后顺序会答反
  • 音画信息冲突时判断不稳,配音与画面的矛盾会让模型摇摆

背后的概念