区分引擎收录正常与异常,关键是看“抓取是否被允许、页面是否被索引、返回内容是否与用户看到的一致”这三类信号。正常收录表现为:目标URL能被站内搜索或带引号查询找到,快照或摘要与页面主要内容一致,robots.txt与meta robots未阻止索引。异常则表现为:URL长期不出现在结果中、摘要明显来自其他页面、或返回的是登录页、错误页。判断时不要只看“site:”命令的总数,它只是估算值,会随查询词和引擎变化。
没有基准就无法判断异常。先为每个待检查URL记录四项信息:完整URL、页面标题、主要正文的一段唯一文字、期望的索引状态(允许/禁止)。
site:你的域名 唯一文字查询,确认该页面是否被收录。<meta name="robots">,确认没有noindex。Disallow。这一步的适用条件是:页面已上线且至少经过一段合理的发现周期。若页面刚发布几小时,结果缺失属于正常延迟,不应直接判定为异常。
把查询结果分成三种状态,分别对应不同结论:
假设某产品页在结果中显示的是网站首页标题,且摘要为“请开启JavaScript”,这是典型的异常:引擎抓取到的内容与用户浏览器看到的不一致。此时应检查该页是否依赖客户端渲染、是否被重定向到首页、是否对爬虫返回了不同内容。
本类事实要求注意:robots.txt的抓取限制不等于可靠的索引移除。被Disallow的URL仍可能因外部链接而被索引,只是摘要可能缺失。站点地图提交也不保证收录,它只帮助发现URL。
单一查询结果不足以定论,至少用两种方式交叉验证:
判断结果时,若两个引擎都显示已收录且摘要正常,可判定为正常;若一个显示收录、另一个查不到,属于引擎间差异,需分别核查,不能用一个引擎的结果推断另一个。
把上述检查做成固定清单,按周或按月执行。重点监控三类变化:
若确认是noindex导致的移除,修正后需等待引擎重新抓取,时间不固定,不能保证立即恢复。若确认是抓取限制,先解除robots.txt中的对应规则,再提交URL检查请求重新抓取。
下一步:选取你当前最关心的一个URL,按“准备”中的四项信息记录基准,再用“实施”中的三种状态对照判断,最后用“验证”中的两种方式交叉确认,得到明确结论后再决定是否修改配置。