先给结论:不要按“已发现/未发现”直接分组,而要先按页面是否共享同一批内链、同一份站点地图提交记录和同一套模板变量来划分对照组。只有把“入口条件”相同的页面放在一组,剩余差异才值得归因;否则你比较的其实是两套不同的抓取路径。
批量页面部分被发现,通常混着三种状态,处理方式完全不同。
动手前先做一件事:从日志或抓取记录中筛出这三类,分别计数。如果“未抓取”的数量远小于“已抓取但不索引”,那你要解决的是内容信号,而不是入口。这个动作会直接决定下一步是补链接还是改页面。
划分对照组的核心原则是:组内页面的入口来源尽量一致,组间只保留一个你打算验证的变量。可以按下面顺序分层。
假设你有 200 个旧产品页,其中 40 个已被抓取。先不要看这 40 个有什么共同点,而是先把 160 个未抓取的页面按“是否有内链指向”分成两组。如果其中 120 个完全没有内链,只有站点地图提到过,那么最可能的解释是入口单一,而不是内容质量差。此时补内链就是优先动作,补完后观察下一轮抓取记录里这 120 个是否开始出现。
当旧内容、旧系统或旧合作关系需要退出时,批量页面的处理目标不是让全部被发现,而是判断哪些值得继续投入入口资源。可以按以下依据分组。
这里要注意一个常见误区:robots.txt 的抓取限制不等于可靠的索引移除。如果页面已经被抓取并索引,仅靠屏蔽抓取并不能保证它从结果中消失;反过来,站点地图也不保证收录。把“退出”理解为“不再主动提供入口”更准确,而不是假设某个文件能一键清空。
把上面的原则落成一个短流程,可以直接套用到你手上的页面清单。
需要说明的是,抓取量或发现量归零或上升,都不能单独证明某个处理正确。抓取频率会受服务器响应、站点整体更新节奏和外部链接变化影响,这些都可能与你的改动同时发生。因此对照组的意义在于缩小解释范围,而不是给出唯一答案。
如果页面主要靠站点地图被发现,那么站点地图的更新频率和提交方式会成为主要变量;如果页面主要靠内链被发现,那么链接位置和链接数量更关键。两者都具备时,优先检查内链,因为内链同时影响抓取路径和页面权重传递。
对于旧系统遗留的批量页面,先确认它们是否还承担跳转、支付回调或合作方对接功能。如果承担,就不适合直接退出入口,而应保留可访问性并单独分组观察。只有在确认没有功能依赖后,才按上面的退出决策处理。这样划分后,你得到的不是一份“已发现/未发现”的简单名单,而是一张能指导下一步动作的分组表。