视频理解
看懂一段视频里发生了什么
视频进阶 #25
输入视频文本文本
这项能力指什么
输入一段视频(可附带问题),输出对内容、事件与时间线的描述或回答,如「三分钟后发生了什么」「这个动作做对了吗」。它在图像理解之上增加了时间维度,要能区分类似画面中先后顺序的不同事件。输入常按帧采样后压缩送入模型。
技术上如何做到
做法是先按固定或自适应策略抽帧,用视觉编码器把每帧变成 token,再把帧间顺序与时间戳一并送入多模态 Transformer,由语言模型生成文字输出。长视频靠层次化摘要、关键帧挑选或记忆机制来控制 token 预算。要精确定位时间点,则会训练专门的时序定位头或让模型输出时间区间。
代表产品
5相关机构
典型用途
- 监控与安防的事件检索
- 体育与健身的动作点评
- 课程与会议的视频概览
- 内容审核与违规片段定位
怎么评价它好不好
- 视频问答准确率
- 在带标注问题上答对的比例
- 时序定位 mIoU
- 预测时间区间与真值区间的平均交并比
- 视频描述 CIDEr
- 描述与参考答案的语义匹配度
边界与难点
- 抽帧采样会丢掉中段细节,长视频里发生一次的事件最容易被漏掉
- 精细时序判断(谁在何时先做了什么)容易含糊,先后顺序会答反
- 音画信息冲突时判断不稳,配音与画面的矛盾会让模型摇摆