跳到正文
AI 图鉴

自主智能体

自己拆解目标、连续行动直到完成

智能体与工具调用进阶 #36
输入文本动作

这项能力指什么

输入一个较宏观的目标(如「把这个 issue 修好」),输出一串连续的操作序列,并在过程中根据反馈调整下一步。与「工具调用」的区别是它把多次调用编排成计划,自己决定顺序与何时停止;与「计算机操作智能体」的区别是它主要作用于代码与 API,而非屏幕上的界面。

技术上如何做到

典型结构是「思考-行动-观察」的循环:模型先规划一步,调用工具或执行代码,读取结果后修正计划,如此往复直到判定完成。能力来自三处叠加:长上下文的语言模型、可执行环境的即时反馈(编译、测试、报错)、以及围绕安全与预算的外层控制(沙箱、步数上限、人工确认点)。

代表产品

5

相关机构

典型用途

  • 自动修复缺陷与提交补丁
  • 数据流水线的编排与执行
  • 调研并整理成报告
  • 重复性运维与脚本化任务

怎么评价它好不好

任务完成率
端到端解决问题的比例,如 SWE-bench 一类评测
步骤数与成本
解决问题所需的调用次数与算力开销
人工接管率
需要人中途介入才能继续的比例

边界与难点

  • 长任务上误差逐步累积,中途走偏后很难自己回到正确方向
  • 会「假装完成」:没有真正验证结果就宣布任务结束
  • 面对删除、发布、支付等高风险动作缺乏可靠的自我刹车,需要外部约束

背后的概念