Agents d’usage de l’ordinateur
Voir l’écran, cliquer et taper comme une personne
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE DÉSIGNE CETTE CAPACITÉ
Takes a task to be done through a user interface — add this column to the sheet — and outputs a sequence of mouse and keyboard actions, with screenshots as the observation at each step. It needs no software API, so it can drive legacy systems that expose none. Unlike an autonomous agent its actions land on a graphical interface rather than code or APIs.
Comment c'est fait
The model treats screenshots as observations and emits actions such as click coordinates, scrolling and typing, advancing in a repeated screenshot–action loop. Training data comes from recordings of human operations and trajectories annotated on synthetic tasks, and evaluation runs on task sets over real websites and desktop apps. To reduce risk, deployments usually run in isolated virtual machines or constrained accounts with confirmation points on sensitive actions.
Produits représentatifs
5Claude
2023Un modèle de conversation général réputé pour son long contexte et son alignement sécurisé
Devin
2024Un agent de code autonome doté de son propre shell, éditeur et navigateur
ChatGPT
2022La fenêtre de discussion qui a mis un grand modèle de langage entre toutes les mains
Gemini
2023Un modèle général nativement multimodal, conçu pour de très longs contextes
Cursor
2023Un éditeur de code de bureau qui prend tout le dépôt comme contexte
Organisations concernées
Usages typiques
- Testing and accepting web flows
- Data entry into legacy systems without APIs
- Automating repetitive back-office operations
- Operating interfaces on behalf of users with accessibility needs
Limites et points difficiles
- Clicks based on screenshot pixel coordinates miss as soon as resolution or page zoom changes
- Captchas, pop-ups, long scrolling and lazy loading make it stall or repeat ineffective actions
- With no reliable intermediate feedback, a wrong click corrupts real accounts and data, so isolated execution is mandatory
Concepts sous-jacents
Agents et utilisation d’outils
Qu’un modèle ne se contente pas de répondre : chercher, appeler des API, exécuter du code — et décider de l’étape suivante d’après le résultat
Ingénierie des prompts et alignement
Rendre un modèle utile, honnête et inoffensif est plus difficile que de simplement l’agrandir
Sécurité, alignement et injection de prompts
Le modèle optimise le proxy inscrit dans la perte, jamais ce que nous voulons vraiment : l’écart entre les deux, c’est tout le problème de l’alignement