开沿科技
13305079753
方法论与思考

Agent 怎么验收业务价值?别只测回答准确率

开沿研发中心·2026-09-04·4 分钟阅读
Agent 怎么验收业务价值?别只测回答准确率

回答准确率适合评估问答样本,却不足以验收企业 Agent。一个回答很准确,但没有写入业务系统;一封邮件生成得很好,却发给了错误客户;一张任务卡创建成功,却没有人处理,都不能算工作完成。

先为每项工作写一个终态

工作 容易被误当成完成 可验收的业务终态
应收跟进 已生成催款话术 到账已认领,或争议/承诺进入有责复查
客诉处理 已生成 8D 报告 措施执行并在约定批次验证,客户状态已回读
项目齐套 已发送缺料提醒 缺口被处理或交期变更经有权人确认
销售拜访 已生成纪要 CRM 事实经人确认写回,下一动作有责任人
知识问答 给出一段答案 引用现行依据,无权内容未泄露,缺口被记录

终态必须能从权威系统或明确回执复核,而不是由 Agent 自己宣布。

七类指标组成验收表

  1. 终态达成率:有效任务中真正完成的比例。
  2. 直通率:无需人工接管即可完成的比例。
  3. 人工小时变化:原流程与新流程在相同任务量下的差异。
  4. 漏错项:漏处理、误处理、重复处理和越权动作。
  5. 异常提前量:比原流程提前多久发现风险。
  6. 写回一致性:动作记录与目标系统回读结果是否一致。
  7. 单位成功任务成本:完整任务的模型、工具和人工成本。

直通率不是越高越好。高风险动作保留人工确认,可能降低直通率,却显著降低错误损失。验收应看风险调整后的整体结果。

基线要在试点前记录

如果上线前没有统计人工耗时、等待时间、错误和任务量,上线后很难证明改进。基线不用追求完美,可先抽取连续两到四周的代表样本,明确数据口径和缺失项。

验收集还要包含正常、异常和无权用例。只用理想数据测 50 道问答,会高估真实生产效果。关于 POC 转生产的路径见企业 AI POC 怎么转生产

把“失败”拆成可行动原因

知识缺失、连接器失效、权限拒绝、模型输出错误、人工超时和客户未回复,不能混成一个失败率。它们对应不同责任人,其中权限拒绝甚至可能代表门禁正确工作。

最终验收报告应让业务负责人回答三个问题:少了多少重复劳动;减少了哪些漏错或等待;每完成一项工作花多少钱。需要把验收指标接入持续运营,可继续了解Agent 可观测性开沿 Agent

指标要同时保留绝对数和比例

只看比例会隐藏任务量变化。终态达成率从 80% 升到 90%,如果有效任务从 100 件降到 20 件,不能直接说明能力提升;异常率不变,但高风险任务数量翻倍,运营压力也完全不同。验收表应同时展示分子、分母、排除项和趋势。

对于人工小时,区分正常确认和异常救火。关键动作保留几十秒确认属于设计要求,不能算无效人工;一线人员反复补字段、重新解释和修错单,才是应减少的成本。

设置上线门槛与停止门槛

上线门槛可以包括零越权、零重复高风险写入、关键回读覆盖、异常有责率和业务指标最低值。停止门槛则规定出现何种错误立即暂停自动动作,例如金额错写、对外误发、权限泄露或连续无法确认结果。

门槛应按风险设置,不能用一个总分抵消红线。即使平均准确率很高,只要出现不可接受的高风险错误,也不能用其他样本“平均掉”。

验收后继续对照原流程

短期试点容易受到业务量、人员投入和新鲜感影响。上线后继续保留一段观察期,按相同口径比较原流程与 Agent 流程;规则、模型或数据源发生重大变化时重新建立版本基线。

业务价值也不应只算节省工资。更早发现交付风险、避免一次错误报价、减少漏单、缩短客户等待,可能比纯工时更重要,但必须用真实记录核验,不能把理论收益直接当实际收益。

7
专注企业数字化
2000+ 家
服务企业
1000+ 个
交付项目
钉钉认证
服务商
把方法用起来

想就你公司当前的状况,聊一下下一步从哪切

看完文章你应该能判断大方向。如果想就具体场景再细聊「第一步先做哪个 / 现有系统能不能复用 / 大概多长周期」,可以加我们顾问微信——30 分钟,免费方案诊断。

看客户案例

常见问题

基于这个话题最常被问到的 3 个具体问题

Q1. Agent 回答准确率达到 90% 是否可以上线?

不能只凭回答准确率决定。还要验证真实任务能否达到业务终态、错误是否被门禁拦截、异常是否有人接管。

Q2. 不同 Agent 能否使用同一套 KPI?

可以共享运行与风险指标,但业务结果必须按工作定义,例如回款、工单、交付缺口和报价的终态不同。

Q3. ROI 应按调用次数还是按任务计算?

应按完整任务或业务对象计算,并计入模型、工具、重试、人工复核和运营成本。

开沿研发中心

开沿研发中心

开沿科技的方法论与技术团队,把一线交付中的经验沉淀成可复用的方法。了解研发中心 →