区分 robots.txt 正常与异常,核心看三点:文件能否被正常访问、语法是否只屏蔽了该屏蔽的路径、实际抓取行为是否与文件规则一致。正常结果是返回 200、规则清晰、目标页面可被抓取;异常则是返回 4xx/5xx、规则误伤全站或关键目录,或搜索结果里出现不该出现的限制路径。时间人手有限时,按下面清单从影响面最大的项开始查。
要查什么:/robots.txt 是否返回 200,内容是否为纯文本。
怎么查:用浏览器直接打开该地址,或用命令行请求头查看状态码。若返回 404,说明文件不存在,抓取默认不受限制;若返回 5xx,说明服务器临时故障,抓取工具可能按错误策略处理;若返回 200 但内容是 HTML 页面,说明配置把错误页面当成了 robots.txt。
结果说明什么:404 不等于异常,但意味着你无法用该文件做精细控制;5xx 和 HTML 内容属于明确异常,应最先修复,因为它们会让规则完全失效或产生不可预测的抓取行为。
要查什么:Disallow 与 Allow 的路径是否指向真正想限制的目录,有没有把整站或核心栏目一起挡住。
怎么查:逐行读规则,重点看三类写法。第一,Disallow: / 会限制全站抓取,除非你确实要临时下线;第二,Disallow: / 后跟空值或只写目录名,容易误伤同前缀路径;第三,Allow 与 Disallow 同时存在时,要看具体抓取工具支持哪条优先,不同搜索引擎对最长匹配和优先级处理不完全一致,须分别核查。
结果说明什么:如果关键栏目、商品页或文章页出现在被限制路径下,属于异常,应调整规则并重新验证。若只限制了后台、搜索结果页、重复筛选参数,属于正常控制。
要查什么:规则写完后,目标 URL 实际是否允许抓取。
怎么查:使用搜索引擎官方提供的 robots.txt 测试工具或抓取测试功能,输入具体 URL,查看“允许/禁止”结果和命中的规则行。没有工具时,可手动比对:把目标 URL 路径与每条规则做前缀匹配,看哪条最长、哪条先命中。
结果说明什么:测试显示允许,但线上抓取仍异常,可能是缓存、CDN 或服务器层拦截,不是 robots.txt 本身的问题。测试显示禁止,但你认为应该允许,说明规则写错或路径判断有误,应优先改规则。
要查什么:被 robots.txt 限制的页面,是否仍出现在搜索结果中。
怎么查:对限制路径做站内搜索或搜索引擎查询,看是否还有摘要或链接。若有,不要直接断定 robots.txt 失效。
结果说明什么:robots.txt 只控制抓取,不保证页面从索引中移除。已经收录的页面即使被限制抓取,仍可能因外部链接或历史数据出现在结果里。要移除索引,应使用页面级 noindex 或搜索引擎提供的移除工具,并确保该页面允许被抓取,否则 noindex 无法被读到。这是正常与异常判断中最容易混淆的一点。
Disallow: / 且无合理原因,视为最高优先级异常。下一步:先修 5xx 和全站误挡这两类高影响异常,再用测试工具逐条验证核心 URL,最后单独处理已收录但需移除的页面。