语音识别
把说的话转写成文字
语音与音乐入门 #27
输入音频文本
这项能力指什么
输入一段音频,输出对应的文字转写,通常还带时间戳与标点。它只负责把声音变成文字,不做理解;与「语音合成」方向相反,与「视频理解」的区别是只处理音轨而不看画面。多人对话场景还要区分离散的说话人。
技术上如何做到
早期用声学模型加语言模型的混合系统,靠隐马尔可夫与发音词典逐帧解码。端到端模型把声学特征直接映射到字符或子词,Whisper 一类做法用大规模多语言弱标注数据训练编码器-解码器,显著提升了噪声与口音下的鲁棒性。流式识别要求模型在音频尚未结束时就开始输出,需要在延迟与准确度之间取舍。
代表产品
6Whisper
2022OpenAI
把多语种语音转写成文字,并翻译成英文
模型 开放权重
音频文本
GPT-4o
2024OpenAI
原生多模态的通用模型,文本、图像与音频走同一个入口
模型 闭源
文本图像音频文本音频
Gemini
2023Google DeepMind
原生多模态、可处理超长上下文的通用模型
模型 闭源
文本图像音频视频文本
Qwen
2023Alibaba (Qwen)
覆盖多规格、含多模态版本的开放权重模型家族
模型 开放权重
文本图像文本
Hunyuan
2023Tencent (Hunyuan)
腾讯的通用模型家族,含开放权重版本
模型 开放权重
文本图像文本
Siri
2011Apple
把语音助手带进主流手机的早期产品
应用 闭源
音频音频文本
相关机构
典型用途
- 会议与访谈的自动纪要
- 字幕生成与视频转写
- 语音输入与语音搜索
- 客服通话的质检与分析
怎么评价它好不好
- 词错误率 WER
- 替换、删除、插入词占真值词数的比例
- 字符错误率 CER
- 中文等无空格语言更常用
- 实时率 RTF
- 处理时长与音频时长的比值,衡量能否实时
边界与难点
- 重叠说话与强背景噪声下错误率陡增,多人抢话时几乎无法分辨
- 口音、方言、专业术语与罕见人名是主要错误来源
- 长音频的时间戳与标点不稳定,断句错误会影响后续阅读与检索