回答准确率适合评估问答样本,却不足以验收企业 Agent。一个回答很准确,但没有写入业务系统;一封邮件生成得很好,却发给了错误客户;一张任务卡创建成功,却没有人处理,都不能算工作完成。
先为每项工作写一个终态
| 工作 | 容易被误当成完成 | 可验收的业务终态 |
|---|---|---|
| 应收跟进 | 已生成催款话术 | 到账已认领,或争议/承诺进入有责复查 |
| 客诉处理 | 已生成 8D 报告 | 措施执行并在约定批次验证,客户状态已回读 |
| 项目齐套 | 已发送缺料提醒 | 缺口被处理或交期变更经有权人确认 |
| 销售拜访 | 已生成纪要 | CRM 事实经人确认写回,下一动作有责任人 |
| 知识问答 | 给出一段答案 | 引用现行依据,无权内容未泄露,缺口被记录 |
终态必须能从权威系统或明确回执复核,而不是由 Agent 自己宣布。
七类指标组成验收表
- 终态达成率:有效任务中真正完成的比例。
- 直通率:无需人工接管即可完成的比例。
- 人工小时变化:原流程与新流程在相同任务量下的差异。
- 漏错项:漏处理、误处理、重复处理和越权动作。
- 异常提前量:比原流程提前多久发现风险。
- 写回一致性:动作记录与目标系统回读结果是否一致。
- 单位成功任务成本:完整任务的模型、工具和人工成本。
直通率不是越高越好。高风险动作保留人工确认,可能降低直通率,却显著降低错误损失。验收应看风险调整后的整体结果。
基线要在试点前记录
如果上线前没有统计人工耗时、等待时间、错误和任务量,上线后很难证明改进。基线不用追求完美,可先抽取连续两到四周的代表样本,明确数据口径和缺失项。
验收集还要包含正常、异常和无权用例。只用理想数据测 50 道问答,会高估真实生产效果。关于 POC 转生产的路径见企业 AI POC 怎么转生产。
把“失败”拆成可行动原因
知识缺失、连接器失效、权限拒绝、模型输出错误、人工超时和客户未回复,不能混成一个失败率。它们对应不同责任人,其中权限拒绝甚至可能代表门禁正确工作。
最终验收报告应让业务负责人回答三个问题:少了多少重复劳动;减少了哪些漏错或等待;每完成一项工作花多少钱。需要把验收指标接入持续运营,可继续了解Agent 可观测性和开沿 Agent。
指标要同时保留绝对数和比例
只看比例会隐藏任务量变化。终态达成率从 80% 升到 90%,如果有效任务从 100 件降到 20 件,不能直接说明能力提升;异常率不变,但高风险任务数量翻倍,运营压力也完全不同。验收表应同时展示分子、分母、排除项和趋势。
对于人工小时,区分正常确认和异常救火。关键动作保留几十秒确认属于设计要求,不能算无效人工;一线人员反复补字段、重新解释和修错单,才是应减少的成本。
设置上线门槛与停止门槛
上线门槛可以包括零越权、零重复高风险写入、关键回读覆盖、异常有责率和业务指标最低值。停止门槛则规定出现何种错误立即暂停自动动作,例如金额错写、对外误发、权限泄露或连续无法确认结果。
门槛应按风险设置,不能用一个总分抵消红线。即使平均准确率很高,只要出现不可接受的高风险错误,也不能用其他样本“平均掉”。
验收后继续对照原流程
短期试点容易受到业务量、人员投入和新鲜感影响。上线后继续保留一段观察期,按相同口径比较原流程与 Agent 流程;规则、模型或数据源发生重大变化时重新建立版本基线。
业务价值也不应只算节省工资。更早发现交付风险、避免一次错误报价、减少漏单、缩短客户等待,可能比纯工时更重要,但必须用真实记录核验,不能把理论收益直接当实际收益。






