计算机操作智能体
像人一样看屏幕、点鼠标、敲键盘
智能体与工具调用进阶 #37
输入文本动作
这项能力指什么
输入一个用界面完成的任务(如「在这份表里补上这一列」),输出一串鼠标与键盘操作,由截图作为每一步的观察。它不依赖任何软件的接口,因此能操作那些没有 API 的旧系统。与「自主智能体」的区别是它的动作作用在图形界面而非代码与接口上。
技术上如何做到
模型把屏幕截图当作观察,输出点击坐标、滚动与键入等动作,在一轮一轮的「截图-动作」循环里推进。训练数据来自人类操作录像与合成任务的轨迹标注,评测则放在真实网页与桌面应用的任务集上。为降低风险,实际部署多运行在隔离的虚拟机或受控账号里,并设置敏感操作的确认点。
代表产品
5相关机构
典型用途
- 测试与验收网页流程
- 在无 API 的老系统里录入数据
- 重复性的后台操作自动化
- 无障碍场景下的界面代操作
边界与难点
- 依赖截图像素坐标的点击在分辨率或页面缩放变化后就会失准
- 遇到验证码、弹窗、长页面滚动与延迟加载时容易卡住或重复无效动作
- 缺少可靠的中间反馈,误操作会直接污染真实账号与数据,因此必须隔离运行