跳到正文
AI 图鉴

语音识别

把说的话转写成文字

语音与音乐入门 #27
输入音频文本

这项能力指什么

输入一段音频,输出对应的文字转写,通常还带时间戳与标点。它只负责把声音变成文字,不做理解;与「语音合成」方向相反,与「视频理解」的区别是只处理音轨而不看画面。多人对话场景还要区分离散的说话人。

技术上如何做到

早期用声学模型加语言模型的混合系统,靠隐马尔可夫与发音词典逐帧解码。端到端模型把声学特征直接映射到字符或子词,Whisper 一类做法用大规模多语言弱标注数据训练编码器-解码器,显著提升了噪声与口音下的鲁棒性。流式识别要求模型在音频尚未结束时就开始输出,需要在延迟与准确度之间取舍。

代表产品

6

相关机构

典型用途

  • 会议与访谈的自动纪要
  • 字幕生成与视频转写
  • 语音输入与语音搜索
  • 客服通话的质检与分析

怎么评价它好不好

词错误率 WER
替换、删除、插入词占真值词数的比例
字符错误率 CER
中文等无空格语言更常用
实时率 RTF
处理时长与音频时长的比值,衡量能否实时

边界与难点

  • 重叠说话与强背景噪声下错误率陡增,多人抢话时几乎无法分辨
  • 口音、方言、专业术语与罕见人名是主要错误来源
  • 长音频的时间戳与标点不稳定,断句错误会影响后续阅读与检索

背后的概念