先给结论:报告页数不等于对象数量,页数偏多通常来自同一对象被拆成多行、多页或多次出现,去重时应先锁定“唯一对象标识”,再决定是合并统计还是保留多条明细。如果报告里没有稳定的唯一标识,就不能靠删行去重,而要先补一个可复核的标识列;如果报告里已有稳定标识,就直接按标识聚合,并单独保留被合并掉的原始行以便追溯。
报告页数与实际对象数量不一致,常见有两种性质完全不同的情况,处理方式相反。
区分方法很直接:抽几页看重复行之间的差异字段。如果除时间戳、抓取批次、页码外其余字段几乎一致,偏向前者;如果每行都对应不同的投放单元或素材,偏向后者。这个判断会直接决定下一步是“聚合”还是“保留结构”。
当报告包含应用ID、计划ID、素材ID这类稳定标识时,去重可以做成可复核的动作,而不是手工删行。
实施动作与结果:假设一份报告有 120 行、标识去重后得到 80 个对象,先不要直接对外说“只有 80 个”。把 120 与 80 的差额按来源页码归类,如果差额集中在某几个页码区间,说明是分页重复;如果均匀分布,可能是多次抓取叠加。这个归类结果决定下一步是修抓取逻辑还是修合并逻辑。
没有唯一标识时,任何“去重”都只是猜测,删掉的行无法证明是重复的。此时正确做法是先补标识,而不是先减数量。
这里的例外是:如果业务只关心总量趋势而不关心单个对象,可以不去重,但必须在报告里写明统计单位是“记录行”而非“对象”。否则读者会默认一行一个对象,得出错误结论。
去重后对象数下降,容易被理解成之前多算了。但页数、抓取量这类数字归零或骤降,本身不能单独证明去重正确,也不能证明抓取失败。合理解释至少有三种:分页重复被合并、抓取范围被收窄、统计口径从记录行改成了对象。要区分它们,看被合并行的来源分布,以及抓取时间范围是否同步变化。只有来源分布指向重复、且时间范围未变时,才更支持“确实是重复”的判断。
把去重当成一次口径确认,而不是一次数据清理。顺序是:先确定唯一对象标识是否存在,再决定聚合还是保留结构,最后记录合并明细和差额来源。假设某次报告显示 200 页、去重后 150 个对象,差额 50 全部来自三个连续页码区间,那么优先怀疑分页重复;若差额分散且每行子项字段都不同,则应保留结构,改为按子项粒度汇报。这个顺序的价值在于:无论结果偏向哪种,下一步该修抓取、修合并还是修口径,都有依据可查,而不是靠删行凑出一个看起来整齐的数字。