历史公示的批量回补:顺序、去重与校验怎么排

回补比日常采集更容易出错
日常采集按天推进,问题容易被及时发现;历史回补一次涉及几个月甚至几年的数据,来源页面可能已经改版、链接失效、附件缺失。如果不设计流程,常见结果是同一项目被重复录入、时间顺序错乱、字段缺失无人发现。回补前先想清楚三件事:补哪些时间范围、从哪些来源补、补完怎么确认。
顺序怎么排
- 从近到远:先补最近三个月,用熟悉的数据验证规则,再往前推进,越早的历史数据页面损坏概率越高。
- 按来源分批:同一来源的页面结构一致,一批处理一个来源,规则调一次就能用一整段。
- 按公示类型分批:不同公示类型的字段差异大,分开处理可以避免字段映射互相干扰。
- 每批留版本号:记录本批的时间范围、来源、规则版本与处理人,便于出问题时定位与回滚。
去重的三个判据
一是唯一编号,若公示本身带编号则优先使用,这是最可靠的判据。二是复合键,用发布主体、项目名称、发布日期与公示类型组合判断,适用于没有编号的公示。三是内容指纹,对正文做规范化处理后取摘要值比较,用于识别同一内容在不同平台的重复发布。三者建议组合使用,先按编号去重,再用复合键与指纹兜底,并把疑似重复的记录单独存放而不是直接删除,供人工确认。
回补后的校验清单
建议逐项确认:时间范围内是否存在明显空档;每个来源的条数是否与该来源的栏目页数量大致匹配;关键字段的缺失率是否在可接受范围;同一项目的多次公示是否按时间正确串联;抽样人工复核的错误率是否达标。这五项通过后,再把回补数据正式并入主库,并在数据说明中记录回补范围与已知缺陷,避免后来者误以为这段数据是完整无缺的。