Compréhension d’images et VQA
Regarder une image et répondre à des questions libres
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE DÉSIGNE CETTE CAPACITÉ
Takes an image, optionally with a text question, and outputs a natural-language description or answer — what the person is doing, where the scene might be. Unlike OCR it targets meaning rather than characters, and unlike classification it answers open-ended questions instead of choosing from a fixed label set.
Comment c'est fait
The mainstream is a multimodal large model: a vision encoder splits the image into patches and encodes them as visual tokens, which are fed with text tokens into one Transformer so the language side produces the answer. Alignment training uses image-caption pairs with contrastive learning, and later instruction tuning teaches question answering. Small text and fine detail are preserved by splitting the image into higher-resolution patches.
Produits représentatifs
9GPT-4o
2024Un modèle général nativement multimodal : texte, image et audio par une même entrée
Gemini
2023Un modèle général nativement multimodal, conçu pour de très longs contextes
Claude
2023Un modèle de conversation général réputé pour son long contexte et son alignement sécurisé
Qwen
2023Une famille à poids ouverts couvrant de nombreuses tailles, avec des versions multimodales
Doubao
2023Le modèle de conversation général et l’application de ByteDance
Kimi
2023Un assistant de conversation chinois réputé pour les longs contextes
GLM
2023Un modèle général chinois parti d’un préentraînement par remplissage de blancs autorégressif
Gemini
2024Une entrée de discussion qui réunit recherche, bureautique et modèle multimodal
ChatGPT
2022La fenêtre de discussion qui a mis un grand modèle de langage entre toutes les mains
Organisations concernées
Usages typiques
- Accessibility and image narration
- Product and listing description from photos
- Assisted reading of industrial and medical images
- Photo management and content search
Comment on l'évalue
- VQA accuracy
- Share answered correctly on annotated question sets
- Captioning CIDEr / SPICE
- Semantic match between captions and references
- Hallucination rate
- Share of captions mentioning objects not in the image
Limites et points difficiles
- Exact counting and spatial relations are unreliable; miscounting people and flipping left-right are common
- Small text, chart readings and dense tables in the image are frequently misread
- The model fills gaps with common sense, describing what should be there as if it were seen
Concepts sous-jacents
Génération multimodale
Un seul modèle qui apprend à parler, dessiner, bouger — et même à modéliser le monde 3D
Mécanisme d’attention
Chaque position peut regarder directement toutes les autres et répartir dynamiquement son attention selon la pertinence
Architecture Transformer
Remplacer le relais mot à mot par une salle où tous parlent en même temps, pour que les dépendances lointaines soient à un saut