跳到正文
AI 图鉴

语音合成

把文字读成自然的人声

语音与音乐入门 #28
输入文本音频

这项能力指什么

输入文字,输出朗读这段文字的音频。它要同时处理发音(读对字)与韵律(哪里停顿、哪里重读),还要带上目标说话人的音色。与「语音识别」方向相反;与「语音克隆」的区别是不要求用少量样本模仿特定人的音色,通常从预设音色里选。

技术上如何做到

现代做法多为两段式:先用声学模型把文本预测成声学中间表示(如梅尔频谱),再用声码器还原成波形;两者都可端到端训练。离散音频 token 加自回归或扩散解码的路线让韵律更自然,也支持零样本模仿音色。文本侧借助音素化与文本规范化处理数字、缩写与多音字。

代表产品

6

相关机构

典型用途

  • 有声书与新闻播报
  • 无障碍朗读与视障辅助
  • 导航、播客与视频配音
  • 客服与智能硬件的应答音

怎么评价它好不好

MOS
主观平均意见分,衡量自然度
可懂度(词错率)
把合成音频再送去识别,看错多少
说话人相似度
与目标音色的接近程度

边界与难点

  • 长句的停顿与重音不自然,整段听下来节奏偏平
  • 数字、专名与多音字会读错,文本规范化出错时整句走调
  • 情感与风格的控制粒度较粗,只有少数系统能精细指定语速与情绪

背后的概念