跳到正文
AI 图鉴

Whisper

把多语种语音转写成文字,并翻译成英文

OpenAI 模型 开放权重
输入音频文本

它是什么

Whisper 是 OpenAI 于 2022 年 9 月发布的语音识别模型,权重与代码开放。它用约 68 万小时的多语种、多任务网络音频训练,把转写、翻译、语种识别等任务统一成一个序列到序列的预测问题。模型采用编码器—解码器结构,输入 30 秒的音频片段。发布时提供了从 tiny 到 large 的多个尺寸,large 版约 15.5 亿参数。

为什么值得记住

它以开放的权重把多语种语音识别做到接近可用,成为大量语音应用与转录工具的默认选择,也是「弱监督加大规模数据」在语音上的代表。

关键规格

参数量
large 版约 15.5 亿
训练数据
约 68 万小时音频
支持语言
约 99 种
权重开放
是(MIT 许可)
架构
编码器—解码器 Transformer

所属能力

相关概念

同类产品