Whisper
Transcrit la parole en plusieurs langues et la traduit en anglais
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE C'EST
Whisper is a speech-recognition model OpenAI released in September 2022, with open weights and code. It was trained on roughly 680,000 hours of multilingual, multitask audio from the web and frames transcription, translation and language identification as a single sequence-to-sequence problem. The model is an encoder–decoder that takes 30-second audio segments as input. It shipped in several sizes from tiny to large, with the large version at about 1.55 billion parameters.
Pourquoi il compte
With open weights it made multilingual speech recognition broadly usable, becoming the default choice in many speech apps and transcription tools, and stands as a leading example of weak supervision with large-scale data in speech.
Caractéristiques clés
- Parameters
- About 1.55B (large)
- Training data
- About 680,000 hours of audio
- Languages
- About 99
- Open weights
- Yes (MIT licence)
- Architecture
- Encoder–decoder transformer
Capacités
Concepts liés
Architecture Transformer
Remplacer le relais mot à mot par une salle où tous parlent en même temps, pour que les dépendances lointaines soient à un saut
Mécanisme d’attention
Chaque position peut regarder directement toutes les autres et répartir dynamiquement son attention selon la pertinence
Pré-entraînement et affinage
Apprendre d’abord la langue sur d’immenses corpus non annotés, puis se spécialiser avec peu de données : le paradigme le plus économe en données