公示数据的抽样复核:抽多少、按什么判合格

为什么必须抽样复核
自动抽取的公示数据一定会出错,原因包括页面改版、字段位置变化、表格与正文混排、数字单位不统一。出错不可怕,可怕的是长期无人发现。抽样复核的作用是用较小的人工成本,估算整批数据的错误率,并判断这批数据能否使用。
抽多少:按错误容忍度定
- 批量在几十条以内,建议全量复核,成本不高且能发现规则问题。
- 批量在几百条量级,可以抽百分之十到百分之二十,且不少于三十条,保证能反映分布。
- 批量在数千条以上,抽百分之五左右即可,但必须连续多批都抽,观察错误率是否稳定。
- 新来源或新规则上线后的第一批,无论多少条都建议提高比例,因为此时的错误多是规则性错误而非偶发。
怎么抽:分层比随机更有效
纯随机抽样容易漏掉集中出现问题的区域。建议分层:按来源网站分层,按公示类型分层,按发布时间分层,再在每层内随机抽取。这样既覆盖了不同页面的结构差异,也能发现某个来源整体失效的情况。抽样名单要留档,注明抽了哪些、谁复核、结论是什么,方便后续追溯。
判定与处理的三档规则
第一档,关键字段错误率低于约定阈值,例如百分之一以内,整批放行,但记录问题样本用于优化规则。第二档,错误率在阈值上下但错误集中在某一来源或某字段,对该部分整段返工重抽,其余放行。第三档,错误率明显偏高或关键字段大面积错误,整批退回重做,同时暂停该来源的自动入库,改为人工确认后再恢复。规则要在团队内部事先约定,避免每次凭感觉判断。