Reconnaissance optique de caractères
Lire le texte d’une image en caractères modifiables
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE DÉSIGNE CETTE CAPACITÉ
Takes an image containing text — a scan, a photo, a screenshot — and outputs the character sequence, usually with location boxes. It reads characters rather than interpreting them: the output is a transcription, not a meaning. Unlike document parsing, which also cares about layout such as tables, columns and reading order, OCR is only responsible for getting the characters right.
Comment c'est fait
The classic pipeline has two steps: a detection network finds quadrilateral boxes for lines or words, then each crop is passed to a sequence recogniser that decodes characters. Recognition moved from CNN plus recurrent layers with connectionist temporal classification to attention decoders and plain convolutional or Transformer designs. More recently, multimodal models transcribe end to end and handle irregular layouts better.
Produits représentatifs
5GPT-4o
2024Un modèle général nativement multimodal : texte, image et audio par une même entrée
Gemini
2023Un modèle général nativement multimodal, conçu pour de très longs contextes
Qwen
2023Une famille à poids ouverts couvrant de nombreuses tailles, avec des versions multimodales
ERNIE
2019Un modèle chinois parti d’un préentraînement enrichi par la connaissance, version phare précoce
Hunyuan
2023La famille de modèles généraux de Tencent, avec des versions à poids ouverts
Organisations concernées
Usages typiques
- Field capture from invoices, receipts and IDs
- Digitising paper archives and books
- Street-sign and licence-plate reading
- Copying text from screenshots and photos
Comment on l'évalue
- Character error rate
- Substitutions, deletions and insertions over the truth length
- Word error rate
- Word-level error rate, sensitive to segmentation
- Detection F1
- Localisation accuracy of text regions
Limites et points difficiles
- Handwriting and poor scans — blurry, skewed, smudged — drive the error rate up sharply
- Vertical text, mixed scripts and decorative fonts are frequently missed or misread
- Tables and formulas come out as a character stream, losing row-column structure and super/subscripts
Concepts sous-jacents
Représentation numérique de l’image
Pour une machine, une photo n’est qu’une pile de grilles de nombres
Réseaux de neurones convolutifs
Remplacer les connexions denses par « regarder localement et réutiliser le même filtre partout » : l’idée qui a rendu la reconnaissance d’images enfin fonctionnelle
Tokenisation
Les modèles ne lisent pas des caractères mais des tokens ; le découpage fixe silencieusement la capacité et le coût