核对抓取限制,核心是确认搜索引擎抓取工具在请求你的页面时,是否被服务器、页面代码或站点规则拦下。做法是先用抓取工具模拟访问目标 URL,再逐层检查 robots.txt、页面 meta 指令、HTTP 响应头和服务器防护规则,最后用日志复查真实抓取记录。只要有一层拦截生效,页面就可能无法被抓取或收录。
“抓取限制”和“收录问题”表现相似,但排查方向不同。先收集证据再判断:
这里的关键判断依据是:抓取工具能否拿到与浏览器一致的正文。拿不到,才优先查抓取限制。
打开站点根目录下的 robots.txt,检查是否有 Disallow: / 或针对目标目录的屏蔽规则。注意规则按路径前缀匹配,Disallow: /admin 不会误伤 /article,但 Disallow: / 会屏蔽全站。若不确定某条规则是否命中目标 URL,可用抓取工具的 robots.txt 测试功能验证。
查看页面 HTML 的 <head> 区域,确认是否存在 <meta name="robots" content="noindex"> 或 nofollow。noindex 表示允许抓取但不要索引,它不会阻止抓取,却会让页面无法进入索引。若同时存在多处 robots meta,以限制更严的一条为准。
有些限制写在响应头而非 HTML 里,例如 X-Robots-Tag: noindex。这种设置常见于 PDF、图片等非 HTML 文件。用抓取工具的响应头查看功能,或在命令行用 curl -I 检查目标 URL 的头部信息。
防火墙、CDN 或频率限制可能对抓取工具返回 403 或 429。判断方法是:用普通浏览器访问同一 URL 是否正常。若浏览器正常而抓取工具被拒,说明限制来自服务器侧,需要检查 IP 白名单、User-Agent 规则或访问频率阈值。
假设某页面返回 200 但内容为空,且日志显示抓取工具请求被 429 拒绝,那么优先处理频率限制,而不是改 meta 标签。这个例子说明:先定位生效的那一层,再动手修改。
解除限制后,不要只看一次请求结果。复查时注意三点:
若抓取已恢复正常但页面仍未被索引,应转向内容质量与索引选择层面排查,而不是继续在抓取限制上反复调整。
下一步:挑一个当前未被索引的 URL,按上面的流程记录状态码、robots 规则和响应头三项证据,先确认限制具体来自哪一层,再决定改哪里。