Agentes que operan computadoras
Ver la pantalla, hacer clic y escribir como una persona
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ SIGNIFICA ESTA CAPACIDAD
Takes a task to be done through a user interface — add this column to the sheet — and outputs a sequence of mouse and keyboard actions, with screenshots as the observation at each step. It needs no software API, so it can drive legacy systems that expose none. Unlike an autonomous agent its actions land on a graphical interface rather than code or APIs.
Cómo se consigue técnicamente
The model treats screenshots as observations and emits actions such as click coordinates, scrolling and typing, advancing in a repeated screenshot–action loop. Training data comes from recordings of human operations and trajectories annotated on synthetic tasks, and evaluation runs on task sets over real websites and desktop apps. To reduce risk, deployments usually run in isolated virtual machines or constrained accounts with confirmation points on sensitive actions.
Productos representativos
5Claude
2023Un modelo de chat general conocido por su contexto largo y su alineación de seguridad
Devin
2024Un agente de código autónomo con su propio shell, editor y navegador
ChatGPT
2022La ventana de chat que puso un gran modelo de lenguaje en manos de todos
Gemini
2023Un modelo general nativamente multimodal, pensado para contextos muy largos
Cursor
2023Un editor de código de escritorio que usa todo el repositorio como contexto
Organizaciones relacionadas
Usos típicos
- Testing and accepting web flows
- Data entry into legacy systems without APIs
- Automating repetitive back-office operations
- Operating interfaces on behalf of users with accessibility needs
Límites y dificultades
- Clicks based on screenshot pixel coordinates miss as soon as resolution or page zoom changes
- Captchas, pop-ups, long scrolling and lazy loading make it stall or repeat ineffective actions
- With no reliable intermediate feedback, a wrong click corrupts real accounts and data, so isolated execution is mandatory
Conceptos detrás
Agentes y uso de herramientas
Que un modelo no solo responda: consulte, llame APIs, ejecute código — y decida el siguiente paso según el resultado
Ingeniería de prompts y alineación
Hacer que un modelo sea útil, honesto e inofensivo es más difícil que simplemente agrandarlo
Seguridad, alineación e inyección de prompts
El modelo optimiza el proxy escrito en la pérdida, nunca lo que de verdad queremos: esa brecha es todo el problema de alineación