核对抓取限制,核心是确认搜索引擎能否正常发现、请求和渲染你的页面。交付时不能只说“已检查”,而要留下三类可验收证据:抓取日志或服务器访问记录、robots.txt与页面级指令的当前内容、以及针对关键URL的抓取测试结果。多人协作下,先约定验收口径,再分配任务,能减少反复返工。
抓取限制的核对结果,最终要能回答“哪个URL被谁、用什么规则挡住了”。因此开工前应收集以下资料,并明确保存位置:
robots.txt文件内容及最后修改人。<meta name="robots">和X-Robots-Tag响应头。这些资料缺一项,核对结论就可能不完整。例如只看了robots.txt,却忽略WAF对特定爬虫的拦截,就会把“被拒绝”误判为“未被发现”。
多人协作时,把核对拆成可独立验收的任务,并指定唯一责任人:
每项任务都应有明确的完成标志,例如“日志中目标爬虫对关键URL返回200”或“robots.txt中无针对该目录的Disallow”。
核对时逐项检查,并记录现象与结论。以下现象各有多种可能原因,不要直接断定唯一原因:
<meta name="robots" content="noindex">:该指令影响收录,但不一定阻止抓取。要区分“抓取限制”和“索引限制”。X-Robots-Tag: noindex:常见于非HTML文件,需检查服务器或CDN配置。判断时以“当前实际返回结果”为准,而不是以历史配置或记忆为准。一次改动前后比较,还要考虑季节、搜索需求变化和数据采集差异,不能仅凭单日数据下结论。
假设某栏目页在改版后流量下降,团队怀疑被抓取限制。可按以下步骤核对:
X-Robots-Tag。<meta name="robots">,确认是否有noindex或nofollow。若结果是robots.txt误写了Disallow,修正后仍需观察一段时间,因为抓取恢复和索引更新不是即时完成的。若结果是WAF拦截,则需要与运维确认放行规则,而不是只改robots.txt。
交付文档应包含:核对日期、执行人、每个关键URL的最终状态、发现的问题、已做的修改、以及修改后的复测结果。验收标准可以设为“所有关键URL均能返回200,且无阻止抓取的指令或规则”。如果暂时无法修改,也要记录限制来源和影响范围,方便下一轮排查。
下一步,选取一个关键URL,按上面的检查项完整走一遍,并把结果填入交接文档。