CAPABILITIES
Ce que l'IA sait faire
Quarante capacités regroupées en neuf familles selon ce sur quoi elles opèrent. Chacune précise ce qu'elle désigne, comment elle est mise en œuvre, à quoi elle sert et quels produits la portent déjà.
Cliquez sur une case pour voir les capacités de ce couple « entrée → sortie ».
Langage et connaissances
10 capacitésDu premier mot écrit à la lecture d'un document entier : cette famille travaille sur les séquences de symboles elles-mêmes — générer, reformuler, traduire, résumer, extraire, rechercher et raisonner.
Génération de texte
Poursuit un texte mot après mot
Conversation et suivi d’instructions
Comprendre l’intention au fil des tours et agir
Traduction automatique
Rendre un texte d’une langue dans une autre
Résumé de texte
Condenser un long texte en une version plus courte et fidèle
Classification de texte et analyse de sentiment
Attribuer une étiquette prédéfinie à un texte
Extraction d’information et NER
Extraire noms, lieux et relations d’un texte libre
Questions-réponses et RAG
Récupère d’abord les preuves, puis répond à partir d’elles
Raisonnement et chaîne de pensée
Décomposer un problème difficile en étapes intermédiaires
Plongements de texte et recherche sémantique
Transformer les phrases en vecteurs et récupérer les plus proches par sens
Réordonnancement des résultats
Réordonner les candidats selon leur pertinence réelle
Compréhension visuelle
7 capacitésApprendre à un modèle à lire une image. De la classification la plus simple au tracé de cadres, à la segmentation pixel par pixel, à la reconnaissance de texte et de visages, jusqu'aux questions sur ce qu'il voit.
Classification d’images
Décider à quelle catégorie appartient toute l’image
Détection d’objets
Encadrer chaque objet et le nommer
Segmentation d’images
Étiqueter chaque pixel selon l’objet auquel il appartient
Estimation de pose et de points clés
Localiser les articulations et reconstruire le squelette
Reconnaissance optique de caractères
Lire le texte d’une image en caractères modifiables
Reconnaissance faciale
Décider si deux visages sont la même personne
Compréhension d’images et VQA
Regarder une image et répondre à des questions libres
Génération et édition d'images
5 capacitésÀ partir d'une description ou d'un croquis, produire, modifier ou restaurer directement une image. C'est la famille de l'IA générative que le grand public a perçue en premier.
Texte vers image
Transformer une phrase en image
Image vers image
Régénérer une image similaire à partir d’une autre
Édition d’image et inpainting
Modifier une zone de l’image par une consigne écrite
Super-résolution et restauration
Rendre nettes des images petites, floues ou anciennes
Détourage et suppression d’arrière-plan
Détourer proprement le sujet de son arrière-plan
Vidéo
4 capacitésLa vidéo, c'est l'image en mouvement plus le temps. Cette famille traite à la fois l'espace et le temps : générer des clips, comprendre les actions, monter les plans et synchroniser les lèvres.
Texte vers vidéo
Transformer une phrase en clip vidéo
Image vers vidéo
Mettre une image fixe en mouvement
Compréhension de vidéo
Comprendre ce qui se passe dans une vidéo
Montage vidéo et synchronisation labiale
Remonter ou redoubler la vidéo pour que les lèvres suivent
Parole et musique
4 capacitésLe son est à la fois une forme d'onde et une série temporelle. La reconnaissance vocale le transforme en texte, la synthèse vocale fait l'inverse ; la génération de musique et d'effets sonores produit directement des éléments écoutables.
Reconnaissance vocale
Transcrire la parole en texte
Synthèse vocale
Lire un texte à voix haute naturellement
Clonage et conversion de voix
Reproduire une voix à partir de quelques extraits
Génération de musique et de sons
Générer une musique ou un effet sonore à partir d’une description
3D
2 capacitésÉlever une entrée bidimensionnelle en actifs tridimensionnels : maillages, nuages de points et scènes rendues. Cette famille se situe en amont du jeu vidéo, du cinéma et de la simulation robotique.
Code et logiciel
2 capacitésLe code est un langage à la grammaire stricte. Cette famille ne se contente pas de compléter la ligne suivante : elle comprend tout un dépôt, exécute des commandes et traque les erreurs pour les corriger.
Agents et usage d'outils
3 capacitésQuand un modèle peut appeler des outils, lire et écrire des fichiers et piloter un navigateur, il cesse de répondre à des questions pour accomplir des tâches. Cette famille s'attache à enchaîner les actions en flux fiables.
Appel d’outils et de fonctions
Laisser le modèle choisir l’API et remplir les arguments
Agents autonomes
Décomposer un objectif et agir jusqu’à l’achèvement
Agents d’usage de l’ordinateur
Voir l’écran, cliquer et taper comme une personne
Données et documents
3 capacitésTransformer des tableaux, des documents et des mises en page désordonnés en champs structurés. C'est le premier obstacle à franchir pour intégrer l'IA dans un vrai processus métier.
Analyse de documents et mise en page
Convertir PDF et scans en données structurées
Sortie structurée
Faire produire au modèle un JSON conforme à un schéma
Détection d’anomalies
Repérer les quelques cas étranges parmi une masse de données normales