语音合成
把文字读成自然的人声
语音与音乐入门 #28
输入文本音频
这项能力指什么
输入文字,输出朗读这段文字的音频。它要同时处理发音(读对字)与韵律(哪里停顿、哪里重读),还要带上目标说话人的音色。与「语音识别」方向相反;与「语音克隆」的区别是不要求用少量样本模仿特定人的音色,通常从预设音色里选。
技术上如何做到
现代做法多为两段式:先用声学模型把文本预测成声学中间表示(如梅尔频谱),再用声码器还原成波形;两者都可端到端训练。离散音频 token 加自回归或扩散解码的路线让韵律更自然,也支持零样本模仿音色。文本侧借助音素化与文本规范化处理数字、缩写与多音字。
代表产品
6相关机构
典型用途
- 有声书与新闻播报
- 无障碍朗读与视障辅助
- 导航、播客与视频配音
- 客服与智能硬件的应答音
怎么评价它好不好
- MOS
- 主观平均意见分,衡量自然度
- 可懂度(词错率)
- 把合成音频再送去识别,看错多少
- 说话人相似度
- 与目标音色的接近程度
边界与难点
- 长句的停顿与重音不自然,整段听下来节奏偏平
- 数字、专名与多音字会读错,文本规范化出错时整句走调
- 情感与风格的控制粒度较粗,只有少数系统能精细指定语速与情绪