视频编辑与口型同步
改画面或换台词,让口型对得上声音
视频进阶 #26
输入视频文本音频视频
这项能力指什么
输入一段视频,加上文字指令或一段新语音,输出被修改过的视频:可以替换台词并重排口型、擦除画面中的物体、或把人物换成虚拟形象。它与「图生视频」的区别是不生成全新素材,而是在已有时间序列上做局部改动并保持连贯。
技术上如何做到
口型同步通常分两路:一路驱动人脸区域的生成,按音素与音频特征重绘嘴部并保持头部姿态与身份;一路在时间上对齐音频与视频,避免漂移。数字人视频则把人物外观建模为可控的三维或神经表示,由文本转出的语音与表情参数驱动。局部物体移除则借用视频补全,用前后帧信息填补被擦除区域并保证时间一致。
代表产品
5相关机构
典型用途
- 多语言配音与译制
- 企业培训与课件口播
- 广告素材的快速改版
- 后期中的穿帮修复与擦除
怎么评价它好不好
- 口型同步 LSE-C / LSE-D
- 音视频特征的一致性距离,越匹配越好
- 人工评分
- 对口型自然度与画面保持的主观打分
- FVD
- 编辑后视频的整体分布质量
边界与难点
- 快语速、非母语发音与含爆破音的句子最容易口型错位
- 长视频编辑后会累积闪烁与身份漂移,同一人物逐渐走形
- 侧脸、低头与遮挡时面部区域预测不稳,嘴部重绘会露出接缝