跳到正文
AI 图鉴

语音克隆与转换

用少量样本复制一个人的音色

语音与音乐进阶 #29
输入音频文本音频

这项能力指什么

输入一段参考音频(目标音色)和要说的文字,输出用该音色说出这段文字的音频。它可分两类:零样本克隆只要几秒样本即可合成;语音转换则保留原音频的内容与节奏,只把音色换成目标人物。与「语音合成」的区别是音色来自样本而非预设。

技术上如何做到

做法是把说话人音色编码成一个与内容解耦的向量,再在合成时把它当作条件注入声学模型;语音转换则把源音频的音色特征替换为目标特征后重建波形。零样本系统靠大规模多说话人数据训练,让音色编码器学会泛化到没见过的说话人。合规上通常配合声纹授权、水印与合成标记来限制滥用。

代表产品

3

相关机构

典型用途

  • 有声内容的统一播报音
  • 多语言译制中的原声保留
  • 无障碍辅助与失声者发声
  • 游戏与动画的角色配音

怎么评价它好不好

说话人相似度 SECS
合成音频与目标音色的嵌入余弦相似度
MOS
主观自然度平均意见分
等错误率 EER
被冒认与误拒相等时的错误率,衡量被冒用风险

边界与难点

  • 只有几秒参考音频时音色不稳,句间会出现「两个人的声音」
  • 跨语言或跨情感迁移会走音,说话人的音色特征随语种漂移
  • 可被用于伪造身份,必须配合授权与水印,否则社交工程与诈骗风险很高

背后的概念