「什么是 Agent 系统」最怕百科式空话。下面用可检验的说法:它是什么、不是什么、怎样判断你面前的产品算不算。

一、一句话
Agent 系统 = 在约束下,为完成可验收目标而组织模型、工具与检查的软件系统。
二、它不是什么
- 不是更会说话的客服话术包;
- 不是无权限设计的自动脚本;
- 不是「接了大模型」的网站皮肤;
- 不是无法审计的黑盒操作手。
三、五问自检
- 有没有明确目标与完成样貌?
- 失败时会不会换策略或停下来?
- 工具是否白名单?
- 高风险是否人工确认?
- 全过程能否回放?
五问里三个「否」,先别叫系统,叫试验。
四、常见组成
| 层级 | 例子 |
|---|---|
| 交互 | 任务表单、对话、工单触发 |
| 编排 | 步骤图、状态机、重试 |
| 智能 | 模型调用、检索 |
| 行动 | API、文档、浏览器自动化 |
| 治理 | 权限、配额、审计、评估 |
五、入门路径
先完成一个只读任务闭环,再加一个写入闸门,再谈多角色。跳级最容易在权限上翻车。
落地记录表
围绕「什么是 Agent 系统?五问判断你看到的是不是货」完成任务后请记录,便于四周复盘:
| 字段 | 说明 |
|---|---|
| 日期 | 任务日 |
| 目标 | 一句话可验收结果 |
| 材料 | 来源链接或系统 |
| 工具权限 | 实际用到的白名单能力 |
| 人工闸门 | 必须人确认的步骤 |
| 评分 | 1-5 与理由 |
| 失败归因 | 材料/权限/提示词/模型/流程 |
| 下轮只改一项 | 一条可执行改进 |
管理重点是返工率、事故率与单次成功成本是否下降,而不是功能清单变长。把高频失败写回模板,系统才会越用越稳。
两周试点排期
将「什么是 Agent 系统?五问判断你看到的是不是货」从个人尝试推到小组时,建议十个工作日:
- 第1天:定唯一场景与成功标准。
- 第2天:脱敏材料包与黄金样例。
- 第3-4天:只读工具跑通。
- 第5天:检查清单与越权拒绝演练。
- 第6-8天:小流量真实任务并每日抽检。
- 第9天:汇总失败类型,只留三条改进。
- 第10天:书面决定扩面、维持或回退。
有日期、样例与抽检,讨论才不会停在「感觉还行」。
原则备忘
- 目标先于工具,工具先于模型品牌。
- 小样本先于全量,闸门先于速度。
- 日志先于体感,回滚先于勇气。
- 权限默认拒绝,开放必须显式。
- 评估集比演示稿重要。
- 名称诚实,避免高估系统。
- 成本按成功任务计。
- 隐私合规是上线条件。
- 一人成功不等于组织就绪。
- 砍范围常常比加模型更有效。
犹豫是否加功能时先问:是否降返工、是否不增加不可追责风险。两问都「是」再投入下一轮。


