Agents autonomes
Décomposer un objectif et agir jusqu’à l’achèvement
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE DÉSIGNE CETTE CAPACITÉ
Takes a higher-level goal — fix this issue — and outputs a sequence of actions, adjusting the next step from feedback along the way. Unlike tool use it orchestrates many calls into a plan, deciding the order and when to stop; unlike a computer-use agent it works mainly through code and APIs rather than a screen interface.
Comment c'est fait
The typical structure is a think–act–observe loop: the model plans a step, calls a tool or runs code, reads the result and revises the plan, repeating until it judges the task done. Capability comes from three things stacked together: a long-context language model, immediate feedback from an executable environment (compilation, tests, errors), and outer controls for safety and budget such as sandboxes, step limits and human checkpoints.
Produits représentatifs
5Devin
2024Un agent de code autonome doté de son propre shell, éditeur et navigateur
Claude Code
2025Un agent de code qui mène des tâches en plusieurs étapes depuis le terminal
LangChain
2022Enchaîner modèles, outils et recherche
Cursor
2023Un éditeur de code de bureau qui prend tout le dépôt comme contexte
ChatGPT
2022La fenêtre de discussion qui a mis un grand modèle de langage entre toutes les mains
Organisations concernées
Usages typiques
- Fixing defects and submitting patches
- Orchestrating and running data pipelines
- Researching and assembling a report
- Repetitive operations and scripted tasks
Comment on l'évalue
- Task completion rate
- Share of problems solved end to end, as in SWE-bench-style evaluation
- Steps and cost
- Calls and compute spent to solve the task
- Human takeover rate
- Share requiring a human to step in mid-task
Limites et points difficiles
- On long tasks errors accumulate, and after drifting off course the agent rarely recovers on its own
- It can declare success without verifying: the task is announced as done while the check never ran
- It lacks a reliable internal brake for high-risk actions such as deleting, deploying or paying, so external guardrails are needed
Concepts sous-jacents
Agents et utilisation d’outils
Qu’un modèle ne se contente pas de répondre : chercher, appeler des API, exécuter du code — et décider de l’étape suivante d’après le résultat
Apprentissage par renforcement à partir de retours humains
Quand la « bonne réponse » ne s’écrit pas en formule, laissons les humains jouer le rôle de la récompense
Sécurité, alignement et injection de prompts
Le modèle optimise le proxy inscrit dans la perte, jamais ce que nous voulons vraiment : l’écart entre les deux, c’est tout le problème de l’alignement