面对几十年攒下的档案,两条弯路最常见:一是把全量扫描上传称作"建成知识中枢",结果新旧混杂、问答不可信;二是一头扎进 OCR 工具比较,识别率成了唯一话题。整理存量档案的起点应是正在发生的业务问题:销售提案要引用历史案例、内容团队要做专题回溯、售后要查老图纸。先定用途,再按用途、权利、时效、来源、价值与整理成本分级,用小范围问答样本验证后再扩量。在资料授权、权限与接入验证后,可由开沿 Agent 辅助执行分级与入库。
分级的五个维度
| 维度 | 先问的问题 | 优先整理 | 可以暂缓 |
|---|---|---|---|
| 用途 | 哪个岗位、哪个高频问题要用它 | 支撑提案、检索与核验的高频专题 | 没有明确提问方的资料 |
| 权利 | 能否对内检索、对外引用 | 内部阅读权限和使用依据已确认 | 版权与客户授权未查清 |
| 时效 | 内容反映到哪天,过期后还剩什么价值 | 现行依据与高价值历史证据 | 已被替代且无人引用 |
| 来源 | 原件在哪、谁保管、可信度如何 | 有原件与保管人 | 来源不明、无法追溯 |
| 价值与成本 | 解答一个业务问题要花多少整理功夫 | 高价值低成本的批次 | 高成本且用途模糊 |
先用小范围问答样本验证
分级不是纸上作业。挑一个高频业务问题,抽一批能覆盖正常、过期、冲突与无权访问情形的相关档案,人工预标标准答案,整理入库后看问答命中与错位情况,再决定这一批算不算整明白、下一批怎么扩。扫描件还要先过字段与结构校验:行列错位、单位混乱的表格入库,只会产出自信的错误答案。
权利与时效决定档案的身份
权利决定资料能被谁看见、引用到哪里:客户案例要查使用授权与命名限制,第三方内容要查版权,涉密资料限定检索范围并在回答时提示边界。时效决定身份:过期资料不是垃圾,可作为历史证据与提案素材,但不能当作现行依据。现行制度与事实要有唯一入口,这是知识库治理的另一层工作。
全量上传不等于知识中枢
没分级就全量上传,代价要过一阵才显现:三份"最终版"互相矛盾、未授权案例被引用进对外提案、整理预算花在无人问津的批次上。知识中枢的价值来自每一份可被引用的资料都有用途、权利与状态标注,不是来自入库总量。
方案示例
以下为场景示例。某有几十年积累的内容机构,先由内容与销售各提三个高频问题,圈出被反复引用的两千份专题档案作为第一批,标授权与时效后入库,先服务提案检索与专题研究;其余按批次排队,每批先过问答样本再扩。Glean 故事中 TIME 让百年存档重新服务销售与研究,可借鉴其让旧档案服务当前销售与研究的用途;本文按业务价值分批整理的步骤是方案建议,并非TIME原文的具体实施顺序;其实施周期与满意度数字属厂商自述,本文不移植。
试点怎么验收
每批整理完成后核对三件事:样本问答命中率与错误分级率、每条回答能否点开出处、未授权内容是否被挡在引用之外。整理成本按批次记录,用来调整下一批的范围与优先级;分级结论随批次留版本,业务问题变了要能回溯当时的判断依据。
扫描件入库前的字段与结构校验,见扫描件表格进入企业知识库的字段校验与验收;现行入口与元数据治理怎么做,见企业知识库为何越用越乱。更多落地方法可顺着AI Agent 落地专题阅读。要为存量档案设计分级与接入方案,可了解企业知识中枢。
来源说明:机制参考 Glean 客户故事 TIME,即对百年历史存档做集中索引以支撑销售与内容研究(原文:https://www.glean.com/resources/customer-stories/time )。该故事为厂商发布、未独立验证,本文不引用其实施周期等数字,场景为本土方案示例。





