先给结论:报告里的“页数”和实际对象数量对不上,通常不是报告坏了,而是同一对象被拆成了多个可抓取或可索引的地址,或者报告把非目标对象也算进了总数。去重的关键动作是先把“什么算一个对象”写死,再让报告按这个口径重新聚合;如果只按地址逐条删除,下一轮导出还会再出现。
把报告和实际对象列表放在一起,先看差异是“多出来”还是“对不上号”。常见有三类,处理方式完全不同。
判断方法很直接:随机抽十条“多出来”的地址,逐条打开,记录它和哪个目标对象对应。如果十条里多数能对应到已有对象,就是第一类;如果多数是分页或筛选页,就是第二类;如果打开后是不同内容,才考虑第三类。
去重前必须先定口径,否则每个人合并的标准不同,结果仍然对不上。规则要能落到字符串处理上,例如:
假设你手上有500条报告记录,目标对象是300个。按上述规则把地址归一化后,如果得到320个唯一键,说明还有约20个属于“同一对象但内容确实不同”的情况,需要人工确认,而不是继续自动合并。这一步的结果直接决定下一步:差值在可解释范围内就进入抽样验证,差值仍然很大就回到源数据排查。
最稳的做法是给每个对象生成一个唯一键,再按唯一键聚合。唯一键可以取“归一化后的路径”或“业务ID”,不要用标题,因为标题会变、会重复、会带后缀。
操作顺序建议是:先归一化,再分组,再统计组内地址数量,最后只保留每组的主地址。这样报告页数会变成“对象数”,而不是“地址数”。如果工具本身不支持自定义归一化,就把导出文件拉到表格或脚本里处理,处理完再回填。不要在原报告里手动删行,因为下次导出会覆盖。
聚合后要检查两件事:一是每个唯一键对应的地址是否真的指向同一内容;二是被合并掉的地址里有没有本来应该独立统计的对象。前者防误合,后者防漏合。
去重完成后,抽两组样本:一组是被合并的,一组是保留的。被合并的样本要确认打开后内容一致或互为同一对象的变体;保留的样本要确认没有被误当成重复。抽样比例不需要固定,但差异越大,抽样越要偏向差异来源。
同时记录这次去重用的规则、执行时间、处理前后数量、以及仍未解释的差值。下一次报告再出现不一致时,先比对这些记录,看是规则没覆盖新出现的参数,还是源数据又新增了重复登记。没有这一步,去重会变成每轮都要重做的手工活。
不同工具对“页数”的统计口径不同,有的按抓取地址计,有的按索引地址计,有的把重定向也算进去。具体到某一款工具当前按哪种口径统计、是否支持自定义归一化、导出字段有哪些,需要以你实际使用的版本和界面为准,不能凭印象假定。
如果工具提供排除规则或规范化设置,优先在工具内配置,让每次导出都按同一口径生成;如果没有,就把归一化和聚合固定成一份可重复执行的表格公式或脚本。判断标准只有一个:同一批数据重复跑两次,对象数量是否稳定一致。稳定了,才说明去重口径真正落地。