把分词工具的检测结果转成任务,核心是先从交付物倒推:你最终要拿到的是可复现的分词质量结论,而不是一份问题清单。因此每条检测结果都要补齐四类信息——证据、动作、责任、验收标准,再按影响面和修复成本排序,形成可分配、可关闭的任务。
任务拆得太细会变成流水账,拆得太粗又无法验收。判断颗粒度的标准是:一条任务能否由一个人在一次工作周期内完成,并且完成后能用同一份测试集重新跑出可对比的结果。如果一条检测结果涉及多个原因,就拆成多条任务;如果多条结果指向同一个根因,就合并成一条。
例如检测发现“日期被切成三个片段”,这可能是词典缺少日期模式,也可能是预处理阶段没有归一化全角数字。这两种原因对应不同的修改位置,应分别建任务,而不是合并成“修复日期分词”。
建议用固定字段承载信息,避免任务描述含糊。可以直接套用下面的结构:
假设一条检测结果是“专有名词被拆开”,任务卡可以写成:证据为某句原文及当前切分输出;动作为向自定义词典补充该词并检查是否与已有规则冲突;责任为词典维护人;验收为重新运行该批次样本,该词不再被拆分,且其他样本的切分结果无新增退化。
不是所有错误都值得立刻修。可以用两个维度快速排序:影响面指该问题在测试集中出现的频次,以及它是否影响下游任务(如检索、分类、实体识别);修复成本指改动范围是单条词典、一条规则,还是需要重新训练模型。
排序依据要写进任务卡,而不是只凭感觉。这样当资源变化时,其他人也能理解为什么某条任务被推迟。
任务关闭不能只看“改完了”,而要看“改对了且没改坏”。验收至少包含两步:一是用触发该任务的原始样本复测,确认问题消失;二是用固定回归集复测,确认没有引入新的切分错误。回归集应包含之前已经修过的典型问题,防止反复。
如果分词工具支持导出对比结果,就把修改前后的切分输出并排保存;如果不支持,就手动记录关键样本的前后变化。验收结论只有两种:通过并关闭,或退回并补充证据。不要用“基本没问题”作为关闭理由。
打开你正在使用的分词工具,导出最近一次检测结果,挑出其中三条,按“证据、动作、责任、验收”四个字段各写一张任务卡。写完后检查:每条任务是否都能由一个人独立完成,验收标准是否能用同一份测试集复测。如果某条卡写不出来,说明检测结果本身还缺少证据,需要先补采样本。