验收企业 AI 的来源引用,应把答案拆成可核查的结论,逐项检查原文是否支持。能打开链接只是起点,还需要定位到具体段落、表格单元格或业务记录,并核对版本和条件。引用越多不代表越可靠,关键是每条依据与结论之间的关系清楚。
本方法适用于制度查询、产品资料问答和项目记录检索。验收应由拿到答案的实际使用者完成一轮,避免管理账号能打开资料、普通员工却只能看到无权访问的链接。
引用验收的检查项
| 检查项 | 通过条件 | 不通过的典型表现 |
|---|---|---|
| 可访问 | 当前使用者能够打开对应依据 | 链接失效或依赖他人账号 |
| 可定位 | 跳到章节、页码或记录位置 | 只指向几百页文件首页 |
| 直接支持 | 原文包含该结论所需信息 | 主题相关但未说明结论 |
| 条件完整 | 保留原文的限制和例外 | 把特定型号范围写成全系列 |
| 版本适用 | 来源对当前对象与日期有效 | 引用历史版回答当前规则 |
| 表达准确 | 结论强度与原文一致 | 把计划实施写成已经完成 |
每个检查项分别记录结果,不能用平均分抵消关键缺陷。一个链接位置准确,但原文没有支持答案中的期限,这条期限仍应判为无依据。
示例:从可申请到已承诺的误写
示例:原文写“满足资料齐备条件的申请,可进入加急评估;评估结果由受理人员确认”。AI 回答“资料齐备后即可加急完成”,并在句末附上原文链接。
该引用能够打开,也能定位到正确段落,但答案把进入评估改成了结果承诺,并省略了确认步骤。正确答案应保留“可进入加急评估”以及受理确认条件。若使用者追问具体完成日期,需要另外查找明确的承诺记录。
这一类错误通过检查链接数量无法发现。验收人员需要逐句对照动作、状态、条件和时间,识别答案是否比证据多走了一步。
结论与证据的对应表
长答案建议在内部保留“结论—证据”对应表,每行列出答案片段、来源标识、原文位置和支持关系。支持关系可以区分直接陈述、多个来源合并和依据不足。对外阅读时仍可保持简洁,只在相应句子后呈现可定位引用。
一个句子包含多个数值或条件时,可拆成多个核验项。例如“某型号支持两种接口并能在某环境运行”,接口数量和环境范围应分别找到依据。不能因为参数表证明了接口信息,就把环境结论一起标成已验证。
表格答案同样需要关联到行或单元格。若每一行都指向同一份资料,要确保每行确实存在对应原文,不能只在表尾挂一个文件链接就结束验收。
多来源推导与计算结果
有些答案来自多个来源的组合,例如依据清单检查缺项,或将多条记录汇总。此时除了原始来源,还应保留使用了哪些记录、采用什么规则、排除了哪些范围,使使用者能够依据完整记录复算或逐项核对。
推导结果需要与原文事实区分。原文没有写出的判断,可以明确表述为根据哪些条件得到的判断;证据不够时就缩小结论范围。引用一份资料不能让后续所有推论自动获得同样的确定性。
来源内容还可能在同一链接下发生变化。因此验收记录应保存版本标识或经授权保留的证据快照,仅记录网址不足以复核当时的答案。对于无法提供稳定段落链接的文件,可以给出文件版本、章节标题和页码组合,并展示允许引用的短片段。资料访问权限变化后,引用展示也应重新检查,不能因为生成时有权就长期沿用可见的原文摘录。
在阅读体验上,引用放在被支持的句子或表格项旁边,避免把十几个链接集中堆到末尾,让员工自行猜测哪份文档支持哪项要求。
验收样本与缺陷记录
样本应覆盖正确引用、相关但不支持、只支持半句话、版本错误、附件替换、无权访问和计算遗漏。每个样本保留提问、生成答案、来源版本及预期支持关系。预期结果应由业务负责人预先核对,不能让生成答案的同一步骤自行宣布通过。
统计时分开记录来源无法访问、位置错误、内容不支持和条件遗漏。它们分别对应链接管理、文档定位、答案生成和规则处理,混成一个引用失败率不便修复。修正后重测原问题及其变体,确认改动没有损坏其他来源引用。
完整业务验收可参考Agent 业务价值验收指标,检索边界可参考企业知识库与 RAG;需要把原文定位纳入交付,可查看企业知识中枢。







