自主智能体
自己拆解目标、连续行动直到完成
智能体与工具调用进阶 #36
输入文本动作
这项能力指什么
输入一个较宏观的目标(如「把这个 issue 修好」),输出一串连续的操作序列,并在过程中根据反馈调整下一步。与「工具调用」的区别是它把多次调用编排成计划,自己决定顺序与何时停止;与「计算机操作智能体」的区别是它主要作用于代码与 API,而非屏幕上的界面。
技术上如何做到
典型结构是「思考-行动-观察」的循环:模型先规划一步,调用工具或执行代码,读取结果后修正计划,如此往复直到判定完成。能力来自三处叠加:长上下文的语言模型、可执行环境的即时反馈(编译、测试、报错)、以及围绕安全与预算的外层控制(沙箱、步数上限、人工确认点)。
代表产品
5相关机构
典型用途
- 自动修复缺陷与提交补丁
- 数据流水线的编排与执行
- 调研并整理成报告
- 重复性运维与脚本化任务
怎么评价它好不好
- 任务完成率
- 端到端解决问题的比例,如 SWE-bench 一类评测
- 步骤数与成本
- 解决问题所需的调用次数与算力开销
- 人工接管率
- 需要人中途介入才能继续的比例
边界与难点
- 长任务上误差逐步累积,中途走偏后很难自己回到正确方向
- 会「假装完成」:没有真正验证结果就宣布任务结束
- 面对删除、发布、支付等高风险动作缺乏可靠的自我刹车,需要外部约束