Агенты управления компьютером
Смотреть на экран, кликать и печатать как человек
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО ЗА ВОЗМОЖНОСТЬ
Takes a task to be done through a user interface — add this column to the sheet — and outputs a sequence of mouse and keyboard actions, with screenshots as the observation at each step. It needs no software API, so it can drive legacy systems that expose none. Unlike an autonomous agent its actions land on a graphical interface rather than code or APIs.
Как это устроено
The model treats screenshots as observations and emits actions such as click coordinates, scrolling and typing, advancing in a repeated screenshot–action loop. Training data comes from recordings of human operations and trajectories annotated on synthetic tasks, and evaluation runs on task sets over real websites and desktop apps. To reduce risk, deployments usually run in isolated virtual machines or constrained accounts with confirmation points on sensitive actions.
Примеры продуктов
5Claude
2023Универсальная диалоговая модель, известная длинным контекстом и выравниванием по безопасности
Devin
2024Автономный агент-программист со своей оболочкой, редактором и браузером
ChatGPT
2022Окно диалога, которое сделало большую языковую модель доступной каждому
Gemini
2023Универсальная модель с нативной мультимодальностью, рассчитанная на очень длинный контекст
Cursor
2023Настольный редактор кода, использующий весь репозиторий как контекст
Связанные организации
Типичное применение
- Testing and accepting web flows
- Data entry into legacy systems without APIs
- Automating repetitive back-office operations
- Operating interfaces on behalf of users with accessibility needs
Границы и трудности
- Clicks based on screenshot pixel coordinates miss as soon as resolution or page zoom changes
- Captchas, pop-ups, long scrolling and lazy loading make it stall or repeat ineffective actions
- With no reliable intermediate feedback, a wrong click corrupts real accounts and data, so isolated execution is mandatory
Концепции в основе
Агенты и использование инструментов
Пусть модель не только отвечает, но и ищет, вызывает API, запускает код — и выбирает следующий шаг по полученному результату
Промптинг и выравнивание
Сделать модель полезной, честной и безопасной труднее, чем просто увеличить её
Безопасность, выравнивание и инъекция промптов
Модель оптимизирует прокси в функции потерь, а не то, что мы действительно хотим; зазор между ними и есть вся проблема выравнивания