OpenAI 在 2026 年 9 月 22 日发布 GPT-6 Luna,将其作为兼顾成本与速度的工作模型选项,并开放 API 使用。发布本身并不能证明它适合某家企业的全部任务。对咨询分类、服务记录整理和资料字段提取,可先用真实业务样本建立小范围评估。官方发布说明
这类工作的难点通常在标签定义。例如“设备不能启动”可能是安装咨询、售后报修,也可能只是询价时提出的假设。模型需要识别语境,系统需要允许保留不确定状态。
可优先测试的文本任务
适合先测试的任务应有明确输入、有限输出和可检查的结果。比如从服务记录中提取设备编号、把咨询分到既有服务目录、识别缺失资料、为人工处理队列排序。涉及付款、价格承诺或设备处置时,分类结果只用于分流。
| 任务 | 合格结果 | 需要转交的情况 |
|---|---|---|
| 咨询分类 | 使用现有标签并附原文依据 | 同时涉及多个业务 |
| 字段提取 | 原文有据、格式正确 | 编号模糊或前后冲突 |
| 重复记录候选 | 列出可能重复的记录 | 无确定业务标识 |
| 紧急程度整理 | 引用明确的时限或故障描述 | 需要专业风险判断 |
重复记录识别只能给候选,不能仅凭语义相似就自动删除。相同设备在不同日期出现相同故障,可能是两次独立事件。
标签规则的准备
每个标签应有定义、正例、反例和冲突处理规则。“紧急”不能只解释成“比较急”,应写明哪些事实构成升级条件,例如约定交期临近、明确停机或多人受影响。没有事实支持时,不靠语气激动程度推断业务损失。
对于允许多标签的任务,需要说明标签间是否有优先级;只允许单标签时,需要提供裁决顺序。规则变更要留版本号,否则今天与下周的分类结果无法比较。
测试集的组成
从历史资料中抽取脱敏样本,由熟悉业务的人先给出标准答案。样本应包含简短口语、长段转述、错别字、否定句、补充消息和信息缺失。另留一组未参与调试的样本,用来检验规则是否只适应已经看过的材料。
示例:计划评估 200 条记录,可分别覆盖常见情况、边界情况和信息不足情况,比例由真实业务分布决定。这个数量是试验设计示例,不是保证准确率所需的统一门槛。涉及低频但后果较大的错误,应单独补充测试。
错误成本的分别统计
不能只看整体正确率。把“普通咨询误判为报修”与“真实停机报修漏进普通咨询”放在一起平均,会掩盖更重要的风险。应按类别记录漏判、误判、待确认和人工改判数量。
如果模型给出自评置信度,不能直接把它当真实概率。是否可以自动通过,应依据验证集表现和业务后果确定。对于关键标签,可要求原文证据与规则条件同时满足。
批量运行中的抽检
上线后保留样本抽检,重点检查新业务词、标签分布突然变化和转人工量异常。新增产品或服务政策时,先更新规则和测试样本,再调整处理流程。已处理记录需要纠错时,应保留原结果和修改原因。
去重时同时核对业务编号、输入资料版本和分类规则版本。三者一致的重复投递可复用既有结果;资料补充或规则变更后应重新处理,并保留新旧结果的关系。失败条目单独补做,避免整批重跑。模型选择与重复处理减少带来的费用变化应分别统计。
进一步可参考销售线索分流和售后报修资料整理。具体岗位任务可从企业 AI 应用场景选择,再制定分类与人工复核规则。







