Agentes que operam o computador
Ver a tela, clicar e digitar como uma pessoa
O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE ESTA CAPACIDADE SIGNIFICA
Takes a task to be done through a user interface — add this column to the sheet — and outputs a sequence of mouse and keyboard actions, with screenshots as the observation at each step. It needs no software API, so it can drive legacy systems that expose none. Unlike an autonomous agent its actions land on a graphical interface rather than code or APIs.
Como é feita tecnicamente
The model treats screenshots as observations and emits actions such as click coordinates, scrolling and typing, advancing in a repeated screenshot–action loop. Training data comes from recordings of human operations and trajectories annotated on synthetic tasks, and evaluation runs on task sets over real websites and desktop apps. To reduce risk, deployments usually run in isolated virtual machines or constrained accounts with confirmation points on sensitive actions.
Produtos representativos
5Claude
2023Um modelo de conversa geral conhecido por contexto longo e alinhamento de segurança
Devin
2024Um agente de código autônomo com shell, editor e navegador próprios
ChatGPT
2022A janela de chat que colocou um grande modelo de linguagem nas mãos de todos
Gemini
2023Um modelo geral nativamente multimodal, feito para contextos muito longos
Cursor
2023Um editor de código de desktop que usa o repositório inteiro como contexto
Organizações relacionadas
Usos típicos
- Testing and accepting web flows
- Data entry into legacy systems without APIs
- Automating repetitive back-office operations
- Operating interfaces on behalf of users with accessibility needs
Limites e dificuldades
- Clicks based on screenshot pixel coordinates miss as soon as resolution or page zoom changes
- Captchas, pop-ups, long scrolling and lazy loading make it stall or repeat ineffective actions
- With no reliable intermediate feedback, a wrong click corrupts real accounts and data, so isolated execution is mandatory
Conceitos por trás
Agentes e uso de ferramentas
Que um modelo não só responda: pesquise, chame APIs, execute código — e decida o próximo passo a partir do resultado
Engenharia de prompts e alinhamento
Tornar um modelo útil, honesto e inofensivo é mais difícil do que apenas torná-lo maior
Segurança, alinhamento e injeção de prompt
O modelo otimiza o proxy escrito na perda, nunca o que realmente queremos — essa lacuna é todo o problema de alinhamento