判断采集是否遗漏,不能只看总流量涨跌,而要把第三方估算流量、搜索引擎报告和站内统计三套口径放在同一时间轴上对比。如果站内统计显示某批页面持续有访问,而搜索引擎报告和第三方工具都没有对应记录,就说明采集环节可能漏掉了这些页面;反之,如果三套数据都低,问题更可能出在内容或需求本身,而不是采集遗漏。
第三方估算工具给出的是模型推算值,搜索引擎报告反映的是已收录并展示后的表现,站内统计记录的是真实到达服务器的请求。三者的覆盖范围不同:站内统计能看到所有被访问的URL,搜索引擎报告只覆盖已处理页面,第三方工具通常只覆盖有一定搜索量的词。判断遗漏时,站内统计是发现线索的起点,搜索引擎报告是核实收录状态的依据,第三方工具只能作为辅助参考,不能单独用来下结论。
要判断采集是否遗漏,先明确最终要交付什么:一份“哪些页面未被采集、原因是什么”的清单。倒推需要以下资料:
把这些清单按URL做交集和差集,差集就是候选遗漏项。没有日志或后台权限时,至少要有站内统计和站点地图两份清单,否则无法区分“没被采集”和“采集了但没展示”。
排查采集遗漏可以按以下顺序执行,每一步都记录结果:
site:查询或搜索引擎后台的URL检查工具,逐批核实这些页面是否已被收录。如果查询结果为空,不等于一定没收录,需要以后台的“已发现但未编入索引”或“已抓取但未编入索引”状态为准。同一个现象可能有多种解释。例如某批页面在站内统计中有访问,但搜索引擎报告中查不到,可能原因包括:页面被robots.txt屏蔽、返回了noindex、服务器对爬虫返回了不同内容、站点地图未包含、内链结构太深。在逐一排除之前,只能列为“可能原因”。只有当日志确认爬虫请求返回了特定状态码,或后台明确显示“已发现但未编入索引”时,才能说“已经定位的原因”。
假设一个例子:某站点有200个产品页,站内统计显示其中80个每天有自然访问,但搜索引擎后台只收录了30个。日志显示爬虫对另外50个页面返回了302跳转。这里的“302跳转”就是已经定位的原因,而不是猜测。如果日志显示爬虫从未请求过这50个页面,那原因更可能是发现路径问题,需要继续查内链和站点地图。
判断采集遗漏的验收标准可以定为:候选遗漏URL清单中,每一条都能归入以下四类之一——已收录、已发现未收录、被规则屏蔽、从未被发现。归入“从未被发现”的URL需要附带发现路径的检查结果,比如内链是否可达、站点地图是否包含。责任上,内容编辑负责确认页面是否应该被收录,技术负责检查robots、状态码和服务器响应,SEO负责汇总三套数据并输出清单。缺少任何一方的确认,清单都不算完成。
下一步:从站内统计中导出近7天有访问但站点地图中不存在的URL,先补进站点地图,再观察日志中爬虫是否在两周内出现对这些URL的请求。如果出现请求但状态码异常,转技术排查;如果始终没有请求,继续检查内链路径。