核对抓取限制,本质是确认搜索引擎的抓取程序能不能正常访问你的页面。最直接的办法是查 robots.txt、页面级 meta 指令、服务器响应状态和日志记录,看它们是否在拦截抓取。时间和人手有限时,先查 robots.txt 和页面响应,再查日志,最后处理细节。
打开浏览器访问你的域名后加 /robots.txt,例如 https://example.com/robots.txt。重点看 Disallow 行。
Disallow: /,表示禁止抓取整站,这是最严重的情况。Disallow: /admin/ 这类目录,说明只挡了部分路径,需要判断被挡目录里有没有你希望获得排名的页面。Allow 和 Sitemap 行,没有禁止项,说明 robots.txt 本身没有拦截。结果说明:robots.txt 是抓取的第一道门。被它挡住的页面,搜索引擎不会去抓,后续的标题、内容优化都无从谈起。发现误挡后,删掉对应 Disallow 行并保存,再重新提交站点地图。
在浏览器打开目标页面,按 F12 打开开发者工具,切到网络面板刷新页面,看状态码。
200:页面可正常访问,抓取没有因为状态码被拦。403 或 401:服务器拒绝访问,抓取程序可能同样被拒。503:服务暂时不可用,频繁出现会让抓取程序降低抓取频率。301 或 302:页面被跳转,要确认跳转终点是否是你想被收录的地址。接着查看页面源代码里的 meta 指令。如果看到 <meta name="robots" content="noindex">,说明这个页面被明确要求不进入索引;如果是 nofollow,则页面本身可被抓取,但其中的链接不被跟踪。结果说明:noindex 影响的是收录,不是抓取;Disallow 影响的是抓取。两者要分开判断。
打开服务器访问日志,搜索抓取程序的 User-Agent 字段,常见标识包含 Googlebot、Bingbot、Baiduspider 等。看三个信息:访问时间、请求的 URL、返回状态码。
403、503,说明抓取程序来了却被服务器挡住。注意:日志里出现抓取程序标识,不等于一定来自官方抓取程序,User-Agent 可以伪造。需要核对反向 DNS 或 IP 归属来确认,这一步在怀疑被恶意抓取时才做。结果说明:日志是判断“实际抓取行为”的证据,比只看配置文件更接近真实情况。
按影响面从大到小排,先做这三步:
Disallow: /。这一步五分钟内能完成,影响整站。noindex 和 403。这一步十分钟内能完成,影响核心页面。如果这三步都没问题,再去看抓取频率、抓取预算和页面加载速度,那些属于更深一层的问题,不适合排在最先处理。
解除抓取限制后,不要只看一两天的数据就下结论。搜索需求本身会随季节和热点变化,数据采集也可能有延迟。比较时至少看同一页面在改动前后各一个完整周期的表现,并排除节假日、促销活动等外部因素。抓取恢复不等于排名立刻变化,中间还隔着收录和重新评估。
下一步:把上面三项检查结果记成一张简表,标出“已确认拦截”和“疑似拦截”的条目,优先处理已确认的那一项,处理完再复查一次日志。