扫描件表格进入企业 AI 知识库前,应把验收单位从“识别了多少字”改为“每个业务字段是否保持原意”。检查重点包括行列归属、单位、跨页表头、合并单元格和脚注。无法可靠识别的字段应保留缺失状态,不能为了生成完整表格自行填值。
这套方法适用于设备参数表、纸质检验记录和扫描版产品目录。正文段落可按段处理,表格则需要保留结构;将每一行简单拼成文本,会丢掉字段之间的对应关系。
原图与抽取结果的对应关系
每份文件入库时记录文件标识、版本与页数;每张表记录页码、表名和图像位置;每条数据记录行列归属。页面上存在印刷页码时,同时保留文件页序和印刷页码,避免审核人员跳到错误页面。
抽取结果应能展示原图局部与结构化字段,让审核人员直接比较。原件保留只读副本,识别修正写入单独记录。否则有人手工修过一个小数点后,后续既无法解释修改依据,也无法区分原稿错误和识别错误。
字段校验清单
| 表格特征 | 需要核对的内容 | 入库处理 |
|---|---|---|
| 多层表头 | 数值对应的产品、条件和指标 | 将完整表头路径写入字段 |
| 合并单元格 | 适用行数与结束位置 | 仅在明确范围内展开 |
| 跨页续表 | 前页表头是否继续适用 | 建立续表关系后再拼接 |
| 单位与倍率 | mm、m、千件、百分比等 | 原始值与标准化值分别保存 |
| 脚注符号 | 星号对应的限制条件 | 将脚注绑定到相关单元格 |
| 空白或横线 | 未填、不适用或沿用 | 保留状态,不默认记为零 |
整表结构确认后再检查数字格式。小数点、负号、范围符号和字母数字混淆都应进入异常检查,但格式合法只能说明“像一个数”,不能证明它属于正确型号或检测项目。
示例:双条件参数表的列错位
示例:一张扫描表列出“常温”和“低温”两组参数,每组各含“额定值”和“上限值”。第二页只印出数据行,没有重复表头。若抽取时把第二页前两列识别为型号和额定值,后面所有数值都可能错位。
正确处理是先确认两页属于同一张续表,将四列分别命名为“常温额定值”“常温上限值”“低温额定值”“低温上限值”,然后比对列边界与行数。若扫描裁切缺失一列,保留缺列状态,不能向左挪动剩余数据来凑齐结构。
假设某行末尾带星号,脚注写明“仅适用于选装部件”。知识库回答该参数时还要带上这一条件。只保存数字和型号,会让后续问答将选装条件误当作所有设备的标准能力。
校验顺序与异常分组
实际验收可按页面完整性、表格结构、字段内容、业务约束的顺序进行。先查是否缺页、重页或表格被裁切,再查行列与合并关系,最后检查数值和条件。前面的结构不成立,继续抽查数字没有意义。
业务约束可以用于发现异常:明细合计与总计是否一致,最小值是否大于最大值,编号是否重复。约束不通过时回查原图;约束通过也不能免除结构核对,例如两列同时互换仍可能维持合计一致。
异常分为图像不可读、结构不确定、字段待确认和原件疑似错误。分别交给补扫人员、资料整理人员与业务负责人处理。不能把所有异常统称为识别失败,再不断重跑同一文件。
重新扫描同一文件时,还要识别重复导入。可以将新旧页面并列比对,确认是清晰度改善、缺页补齐还是业务内容修订。前两种情况更新图像证据,后一种情况建立新版本,避免同一条参数在知识库中出现两条无法区分的记录。验收表中也应记录每张表预期行数、实际行数以及缺失行的位置,以免抽取内容看起来整齐,却遗漏了整段数据。
入库范围与抽样边界
影响选型、计算和作业条件的关键字段应逐项核对。普通说明文字可按版式分层抽样,但一旦发现跨页表头或合并单元格错误,应将核对范围扩大到同类版式,逐一检查未被抽中的数据行。
验收结果同时记录已确认字段、待确认字段和禁止用于回答的字段。正文部分已合格时可以先入库;存在疑问的表格隔离处理。页面上传成功、索引完成和能搜到文件,都不能代替字段验收。
最后使用真实问法验证:“某型号在某条件下的上限是多少?”答案应命中正确单元格,同时给出条件、单位、版本和原图位置。方法衔接可参考产品选型知识服务和企业知识库与 RAG;资料整理与检索建设可查看企业知识中枢。







