Analyse de documents et mise en page
Convertir PDF et scans en données structurées
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE DÉSIGNE CETTE CAPACITÉ
Takes a document — a PDF page image or a scan — and outputs structured content: paragraphs, heading levels, tables, figure captions, and the correct reading order. Unlike OCR it does more than transcribe: it decides what each block is and which comes first. Unlike information extraction it first rebuilds the layout skeleton rather than targeting specific fields.
Comment c'est fait
A typical pipeline segments the page into regions — text blocks, headings, tables, figures — with detection or segmentation, then handles each: text blocks go through recognition, tables recover row-column and merged-cell structure, and formulas and charts are modelled separately. A layout model predicts block order, and multi-column or cross-column content needs dedicated sorting. Another route hands the whole page to a multimodal model that emits structured markup directly.
Produits représentatifs
7GPT-4o
2024Un modèle général nativement multimodal : texte, image et audio par une même entrée
Gemini
2023Un modèle général nativement multimodal, conçu pour de très longs contextes
Claude
2023Un modèle de conversation général réputé pour son long contexte et son alignement sécurisé
Qwen
2023Une famille à poids ouverts couvrant de nombreuses tailles, avec des versions multimodales
ERNIE
2019Un modèle chinois parti d’un préentraînement enrichi par la connaissance, version phare précoce
Hunyuan
2023La famille de modèles généraux de Tencent, avec des versions à poids ouverts
NotebookLM
2023Ne répond qu’à partir de vos sources, citations à l’appui
Organisations concernées
Usages typiques
- Structuring invoices, contracts and forms
- Table extraction from filings and research reports
- Digitising archives and case files
- Paper ingestion and knowledge-base building
Comment on l'évalue
- Layout element F1
- Correctness of region classification such as heading, table and body
- Table TEDS
- Similarity of table structure trees, measuring row-column recovery
- Reading-order accuracy
- Agreement of the block sequence with the document logic
Limites et points difficiles
- Cross-page tables and merged cells are hard to recover, misaligning rows or losing hierarchy
- Handwritten notes, stamps and stickers disrupt segmentation and cause missed content
- Skew, perspective and binding shadows in scans make column and table boundaries misjudged
Concepts sous-jacents
Représentation numérique de l’image
Pour une machine, une photo n’est qu’une pile de grilles de nombres
Mécanisme d’attention
Chaque position peut regarder directement toutes les autres et répartir dynamiquement son attention selon la pertinence
Architecture Transformer
Remplacer le relais mot à mot par une salle où tous parlent en même temps, pour que les dépendances lointaines soient à un saut