自动化流程跑得顺时几乎看不见,一旦失败却可能重复发送、漏处理或写入错误数据。把“失败后怎么办”当成流程设计的一部分,比事后人工救火更重要。每一步都应明确:能否重试、最多几次、什么情况下停止、谁会收到告警、人工接手后怎样恢复。

把失败分成三类
临时失败如网络波动、短暂限流,通常可在等待后有限重试;数据失败如字段缺失、格式不对,需要停止并补全资料;业务失败如金额异常、权限不足或重复执行风险,必须转人工判断。不要用同一种“再试一次”覆盖所有错误。
| 失败类型 | 默认动作 | 必须保留的记录 |
|---|---|---|
| 临时性错误 | 间隔重试并设上限 | 次数、间隔和最终状态 |
| 数据错误 | 停止并创建待补任务 | 缺失字段和来源 |
| 业务或安全错误 | 冻结后转人工 | 影响范围和审批人 |
| 未知错误 | 保留上下文并升级排查 | 请求标识和时间线 |
告警内容要让人能行动
一条有效告警要说明哪个流程、哪一步、影响什么、已经重试几次、下一步由谁处理,以及查看详情的位置。只发“任务失败”会制造新的排障工作。涉及用户数据时,告警中只放必要的脱敏信息。
人工接管需要可恢复的状态
接手人应能看到输入、已执行步骤、未执行步骤和是否可以安全重跑。对可能产生重复操作的步骤,使用幂等标识或人工确认,不要简单点击重试。流程上线前的整体设计,可以接着阅读 AI 自动化流程上线前的验收方法。
每次失败都应更新流程
把失败原因、实际影响、处置时间和预防动作写进复盘。若同类失败重复出现,优先修复数据校验、边界判断或告警路径,而不是一味增加重试次数。




