输入音频文本
它是什么
Whisper 是 OpenAI 于 2022 年 9 月发布的语音识别模型,权重与代码开放。它用约 68 万小时的多语种、多任务网络音频训练,把转写、翻译、语种识别等任务统一成一个序列到序列的预测问题。模型采用编码器—解码器结构,输入 30 秒的音频片段。发布时提供了从 tiny 到 large 的多个尺寸,large 版约 15.5 亿参数。
为什么值得记住
它以开放的权重把多语种语音识别做到接近可用,成为大量语音应用与转录工具的默认选择,也是「弱监督加大规模数据」在语音上的代表。
关键规格
- 参数量
- large 版约 15.5 亿
- 训练数据
- 约 68 万小时音频
- 支持语言
- 约 99 种
- 权重开放
- 是(MIT 许可)
- 架构
- 编码器—解码器 Transformer