跳到正文
AI 图鉴

计算机操作智能体

像人一样看屏幕、点鼠标、敲键盘

智能体与工具调用进阶 #37
输入文本动作

这项能力指什么

输入一个用界面完成的任务(如「在这份表里补上这一列」),输出一串鼠标与键盘操作,由截图作为每一步的观察。它不依赖任何软件的接口,因此能操作那些没有 API 的旧系统。与「自主智能体」的区别是它的动作作用在图形界面而非代码与接口上。

技术上如何做到

模型把屏幕截图当作观察,输出点击坐标、滚动与键入等动作,在一轮一轮的「截图-动作」循环里推进。训练数据来自人类操作录像与合成任务的轨迹标注,评测则放在真实网页与桌面应用的任务集上。为降低风险,实际部署多运行在隔离的虚拟机或受控账号里,并设置敏感操作的确认点。

代表产品

5

相关机构

典型用途

  • 测试与验收网页流程
  • 在无 API 的老系统里录入数据
  • 重复性的后台操作自动化
  • 无障碍场景下的界面代操作

边界与难点

  • 依赖截图像素坐标的点击在分辨率或页面缩放变化后就会失准
  • 遇到验证码、弹窗、长页面滚动与延迟加载时容易卡住或重复无效动作
  • 缺少可靠的中间反馈,误操作会直接污染真实账号与数据,因此必须隔离运行

背后的概念