核对抓取限制,核心是确认搜索引擎的抓取程序能否正常访问你的页面。具体做法是:先查看 robots.txt 是否误屏蔽,再检查页面是否被 noindex 或登录墙挡住,最后用抓取工具或日志验证真实请求结果。下面从一个假设例子展开,说明每一步怎么查、什么结果代表有问题。
假设你运营一个企业站,某产品栏目页上线两周,在搜索结果里始终找不到。你怀疑是抓取限制,但不确定从哪查。按下面顺序排查,可以逐步缩小范围。
你的域名/robots.txt,搜索该栏目路径。如果看到 Disallow: /products/,说明抓取被禁止。<head> 部分,确认是否有 <meta name="robots" content="noindex">。有则页面即使被抓取也不会进入索引。这个例子里,如果第 1 步就发现 Disallow,那问题基本定位在 robots.txt;如果 robots.txt 放行、但日志里该 URL 返回 403 或 302 到登录页,问题更可能在访问权限或跳转配置。
robots.txt 是抓取限制最常见的位置。核对时注意三点:
Disallow: / 会屏蔽整站,Disallow: /*? 可能误伤带参数的正常页面。Disallow: /,前台页面也会被挡。判断结果:如果目标 URL 被某条 Disallow 规则覆盖,抓取就会被限制;如果没有任何规则匹配,robots.txt 不是当前原因,需要继续查页面级限制。
robots.txt 放行不代表页面一定能被索引。页面内还有几类限制需要核对:
<meta name="robots" content="noindex">:明确告诉搜索引擎不要索引该页。X-Robots-Tag 响应头:在 HTTP 头里设置 noindex,效果与 meta 类似,但更容易被忽略。检查时直接查看页面源代码和响应头。如果发现 noindex 或 canonical 指向别处,先确认这是有意设置还是模板误带。模板误带是常见错误,尤其是新站复制旧模板时。
规则配置正确,不等于抓取程序真的来过。最可靠的验证是服务器日志。筛选抓取程序的 User-Agent,看目标 URL 的请求记录:
200:抓取正常,问题可能在内容质量或索引阶段。403 或 401:访问被拒绝,检查防火墙、CDN 或权限配置。302 到登录页:抓取被跳转拦截。也可以使用搜索引擎官方提供的抓取测试工具,输入 URL 后查看返回的 HTML 和状态码。注意:工具显示的是测试抓取结果,不完全等于真实抓取频率和索引结果。
解除抓取限制后,不要只看第二天是否收录。搜索需求会随季节波动,数据采集也有延迟,一次改动前后比较应至少观察数周,并同时看抓取日志、索引数量和流量趋势。如果改动后抓取请求增加但索引未变,说明限制已解除,瓶颈转移到内容或权重层面。
下一步:挑一个你怀疑被限制的 URL,按“robots.txt → 页面 meta → 响应头 → 服务器日志”的顺序查一遍,把每一步的实际结果记下来,再决定是否需要修改配置。