站点运营

站点运营:robots.txt 与 Sitemap 一致性自查,别让规则和地图互相打架

robots.txt 负责屏蔽,Sitemap 负责推荐,方向相反却必须保持一致。本文梳理栏目下线、域名变更、改版上线后常见的文件不一致场景,给出可逐条执行的核对清单和验证方法,帮助减少无效抓取、避免正常页面被漏掉。

站点运营

站点运营:robots.txt 与 Sitemap 一致性自查,别让规则和地图互相打架

很多站点在改版、换域名或者调整栏目之后,只记得改页面,忘了顺手看一眼 robots.txt 和 Sitemap。这两个文件,一个负责告诉蜘蛛哪些地方别去,一个负责把希望被发现的地址交出去。只要它们对不上,就容易出现两种结果:该被发现的页面一直躺在角落里,或者本该屏蔽的地址被反复抓取,白白消耗服务器资源。

两个文件各自管什么

robots.txt 放在站点根目录,用抓取规则告诉搜索引擎哪些路径可以抓、哪些不要抓。Sitemap 则是你主动提交的地址清单,通常是 XML 格式,也可以是一份纯文本列表。前者是限制,后者是推荐,方向相反,但目标一致:让有价值的页面顺利被发现,让无意义的地址少被浪费。

常见的不一致场景

  • 栏目已经下线,robots.txt 里的 Disallow 规则还留着,Sitemap 也仍在提交这批地址。
  • Sitemap 里的地址带着多余参数或大小写变体,与页面实际地址对不上。
  • 测试期间全站被临时屏蔽过,正式上线后忘了删掉那条 Disallow: /。
  • Sitemap 只提交首页和几个栏目页,大量正常内容页从来没被列出。
  • 换了域名之后,Sitemap 里还是旧域名,旧的屏蔽规则倒是原样保留。

自查清单

先看 robots.txt

  1. 直接访问 域名/robots.txt,确认返回的是文件本身,而不是 404 或首页内容。
  2. 逐条读 Disallow,问自己:现在还需要屏蔽吗?路径是否写对,注意结尾斜杠和大小写。
  3. 确认没有误伤 CSS、JS、图片等页面渲染所需要的资源路径。
  4. 检查声明 Sitemap 的那一行,里面的地址要能正常打开。

再看 Sitemap

  1. 打开文件,抽查十几条地址逐条访问,确认都能打开且指向真实内容页。
  2. 剔除已下线的栏目、已合并的页面、重定向地址和返回 404 的地址。
  3. 确认没有把 robots.txt 里明确禁止抓取的地址放进 Sitemap。
  4. 补上近期发布但没被列出的新页面,尤其是入口很少的深层内容。
  5. 检查文件本身能否正常访问、格式是否合法、有没有超出体积上限。
机器人协议和站点地图不会直接决定收录结果,但它们会实实在在影响蜘蛛的抓取效率。保持两者一致,是站点运营里成本最低的一类日常维护。

改完之后的验证

改动不要做完就丢在一边。修改 robots.txt 后,隔几天观察访问日志里的蜘蛛记录,看被屏蔽路径的请求量是否下降;更新 Sitemap 后,留意新地址是否开始出现抓取请求。如果几天过去毫无变化,优先怀疑文件访问异常、地址写错,或者被某条规则挡住了。

对新站或改版站,可以先在一个小栏目范围内跑通流程:先确认页面可访问,再确认规则允许抓取,最后把地址加进 Sitemap。这条链路走通一次,后面按同样方式批量处理就不容易出错。

把它变成固定动作

建议在每次栏目调整、域名变更、批量下线页面之后,固定做一次这两个文件的核对,并把结果记在运营笔记里。文件不大,改一次只要几分钟,省下的却是后续反复排查抓取异常的时间。