robots.txt 往往是最早被创建、也最久没被打开过的文件之一。它只有几行,很多人写完就忘了,直到某天发现蜘蛛来得越来越少,才回头翻出这条规则。定期自查这份文件,成本很低,但能避开一些代价不小的失误。
先确认它想表达什么
打开文件时别急着看语法,先问一句:这份文件现在的意图,和站点当前的目标一致吗。测试期的全局屏蔽、临时下线的栏目、已经废弃的目录规则,都可能还留在里面,用户看不到任何异常,蜘蛛却会照着执行。
几个高频问题
上线后忘记删掉全局屏蔽
开发环境里常见的写法是禁止一切抓取,站点上线时如果忘了删除,蜘蛛进来第一眼就会离开。这类规则通常放在文件最前面,自查时先看头几行有没有针对整站的禁止声明。
顺手屏蔽了样式与脚本文件
有些模板会集中屏蔽静态资源目录,本意是减少抓取量,但这会让渲染环节拿不到页面样式,影响对页面结构的判断。样式、脚本这类渲染必需的资源,一般建议保持可抓取。
Sitemap 地址写错或位置不对
- 地址是否可访问,返回状态是否正常;
- 是否指向最新的站点地图入口,而不是几个月前的旧文件;
- 如果站点有多个子域或语言版本,是否只声明了其中一个。
另外,robots.txt 只对根目录生效,放在子目录里通常不会被读取。改域名、换目录之后,这条也要重新确认。
可执行的自查清单
- 逐行读一遍,确认每条规则对应的目录真实存在且仍需限制;
- 检查是否有针对整站的禁止声明,以及它是不是临时规则;
- 确认 CSS、JS、图片等渲染资源没有被误挡;
- 检查通配符与结尾符号的使用是否符合预期,避免范围比想象中更大;
- 核对 Sitemap 地址拼写与实际位置;
- 确认文件本身返回正常状态,而不是错误页;
- 把这次检查的结论和日期记下来,方便下次比对。
改完之后怎么验证
改完不要只看文件内容,最好用搜索引擎提供的抓取测试工具跑一遍关键地址,看结果是否符合预期。之后几天留意思维日志里的蜘蛛访问记录,观察被挡住的目录请求是否还在出现,以此确认规则已经生效。
robots.txt 是抓取建议,不是访问控制手段,也不代表被写的地址就不会出现在结果里。真正的权限问题要靠登录校验来解决。
这份文件不需要频繁改动,但值得在结构大调整、域名迁移、栏目上下线之后重新看一眼。把它当成一次两分钟的例行检查,比事后排查抓取异常要轻松得多。