Détection d’objets
Encadrer chaque objet et le nommer
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE DÉSIGNE CETTE CAPACITÉ
Takes an image and outputs a set of bounding boxes, each with a class label and a confidence score. Unlike classification it is not content with one label for the whole image but must say what is where; unlike segmentation it gives rectangles rather than pixel-accurate outlines. Several instances of the same class can be detected at once.
Comment c'est fait
The mainstream is single-stage detection: anchors or centre points are densely predicted on a feature map and one forward pass regresses both box location and class at once, the YOLO line and SSD being the classic examples, fast enough for real time. Two-stage detectors first propose regions then classify each, slightly more accurate but slower. The loss optimises localisation and classification together, and non-maximum suppression merges overlapping boxes at the end.
Produits représentatifs
4Gemini
2023Un modèle général nativement multimodal, conçu pour de très longs contextes
GPT-4o
2024Un modèle général nativement multimodal : texte, image et audio par une même entrée
Qwen
2023Une famille à poids ouverts couvrant de nombreuses tailles, avec des versions multimodales
Waymo Driver
2009Un système de conduite autonome exploitant des robotaxis commerciaux sans agent de sécurité
Organisations concernées
Usages typiques
- Vehicle and pedestrian perception for driving
- Video surveillance and perimeter alerts
- Shelf and inventory counting in retail
- Object surveys in remote-sensing imagery
Comment on l'évalue
- mAP
- Mean of per-class average precision, usually at an IoU threshold
- IoU
- Intersection over union between predicted and true boxes, the hit criterion
- Inference speed (FPS)
- As important as accuracy in real-time settings
Limites et points difficiles
- Recall drops sharply for occluded, truncated and very small objects
- In crowded scenes non-maximum suppression wrongly removes neighbours; two people side by side may become one
- Objects outside the trained classes are either missed or forced into the nearest known class
Concepts sous-jacents
Détection d’objets
De « qu’y a-t-il dans l’image » à « quoi, où et combien »
Réseaux de neurones convolutifs
Remplacer les connexions denses par « regarder localement et réutiliser le même filtre partout » : l’idée qui a rendu la reconnaissance d’images enfin fonctionnelle
Représentation numérique de l’image
Pour une machine, une photo n’est qu’une pile de grilles de nombres