结论是:不能只凭“扫描到多少条”判断覆盖范围,而要用“已完成的边界标记+中断点记录”重建进度。若软件把已抓取和已分析分开记录,你能较准确判断;若它只给一个总量进度条,覆盖范围通常无法可靠还原,需要重新扫描或分批补扫。
全站扫描一般包含两步:先发现并抓取网址,再对抓取结果做解析和规则判断。中断发生在哪一步,决定了你能否沿用已有结果。
实际动作:在软件的结果列表里按“状态”或“抓取时间”排序,导出当前全部记录。如果导出文件里既有“已抓取未分析”又有“未抓取”,说明覆盖不完整,不能直接当作全站结论使用。
中断后想判断覆盖到哪,需要找到能区分“已处理”和“未处理”的痕迹。以下三类证据中,至少要有两类能对上,结论才比较可靠。
反例:某次中断后结果列表显示“已扫描 1 万条”,看起来规模正常,但其中大量条目只有网址、没有标题和状态码。这类记录属于“发现但未抓取”,把它算进覆盖范围会高估进度。这说明单看条数会失效,必须看字段完整度。
假设软件按字母顺序或入库顺序处理网址,中断通常停在一个连续区间。你可以抽取三个位置做验证:
如果“最后一批”字段完整、“边界之后”完全缺失,说明覆盖边界清晰,可以只补扫缺失区间。如果边界附近字段残缺、状态混乱,说明中断点不干净,继续沿用旧结果容易把半成品当成已完成,此时重新扫描或按目录分批重跑更稳妥。
这个判断有适用条件:它依赖软件按固定顺序处理且结果可导出。若软件采用多线程乱序抓取,时间戳和顺序都不再对应,抽样验证的结论就不成立,只能以网址清单去重比对为准。
覆盖范围判断清楚后,动作取决于缺口形态:
补扫完成后,把新旧结果按网址去重合并,再核对总数是否接近站点地图或内链发现量。若合并后仍明显偏少,说明发现阶段本身有遗漏,需要检查入口清单而不是继续补抓。具体软件是否支持断点续扫、分批导出或去重合并,需要以你所用版本的说明和实际界面为准。