站点运营

站点运营:robots.txt 與 Sitemap 一致性自查,別让規則和地图互相打架

robots.txt 负责屏蔽,Sitemap 负责推荐,方向相反却必须保持一致。本文梳理栏目下线、域名變更、改版上线後常见的文件不一致场景,给出可逐條执行的核對清單和驗證方法,帮助减少無效抓取、避免正常頁面被漏掉。

站点运营

站点运营:robots.txt 與 Sitemap 一致性自查,別让規則和地图互相打架

很多站点在改版、換域名或者調整栏目之後,只记得改頁面,忘了顺手看一眼 robots.txt 和 Sitemap。這两個文件,一個负责告诉蜘蛛哪些地方別去,一個负责把希望被發現的地址交出去。只要它們對不上,就容易出現两種结果:该被發現的頁面一直躺在角落里,或者本该屏蔽的地址被反复抓取,白白消耗服務器资源。

两個文件各自管什么

robots.txt 放在站点根目錄,用抓取規則告诉搜尋引擎哪些路径可以抓、哪些不要抓。Sitemap 則是你主動提交的地址清單,通常是 XML 格式,也可以是一份纯文本列表。前者是限制,後者是推荐,方向相反,但目标一致:让有價值的頁面顺利被發現,让無意义的地址少被浪費。

常见的不一致场景

  • 栏目已经下线,robots.txt 里的 Disallow 規則還留着,Sitemap 也仍在提交這批地址。
  • Sitemap 里的地址带着多余參數或大小寫變体,與頁面實际地址對不上。
  • 測試期間全站被临时屏蔽過,正式上线後忘了删掉那條 Disallow: /。
  • Sitemap 只提交首頁和几個栏目頁,大量正常内容頁從来没被列出。
  • 換了域名之後,Sitemap 里還是舊域名,舊的屏蔽規則倒是原样保留。

自查清單

先看 robots.txt

  1. 直接訪問 域名/robots.txt,確認返回的是文件本身,而不是 404 或首頁内容。
  2. 逐條讀 Disallow,問自己:現在還需要屏蔽吗?路径是否寫對,注意结尾斜杠和大小寫。
  3. 確認没有誤伤 CSS、JS、图片等頁面渲染所需要的资源路径。
  4. 检查声明 Sitemap 的那一行,里面的地址要能正常打開。

再看 Sitemap

  1. 打開文件,抽查十几條地址逐條訪問,確認都能打開且指向真實内容頁。
  2. 剔除已下线的栏目、已合並的頁面、重定向地址和返回 404 的地址。
  3. 確認没有把 robots.txt 里明确禁止抓取的地址放進 Sitemap。
  4. 补上近期發布但没被列出的新頁面,尤其是入口很少的深层内容。
  5. 检查文件本身能否正常訪問、格式是否合法、有没有超出体积上限。
机器人协议和站点地图不會直接决定收錄结果,但它們會實實在在影响蜘蛛的抓取效率。保持两者一致,是站点运营里成本最低的一類日常维護。

改完之後的驗證

改動不要做完就丢在一邊。修改 robots.txt 後,隔几天观察訪問日誌里的蜘蛛记錄,看被屏蔽路径的請求量是否下降;更新 Sitemap 後,留意新地址是否開始出現抓取請求。如果几天過去毫無變化,優先怀疑文件訪問異常、地址寫错,或者被某條規則挡住了。

對新站或改版站,可以先在一個小栏目范围内跑通流程:先確認頁面可訪問,再確認規則允许抓取,最後把地址加進 Sitemap。這條鏈路走通一次,後面按同样方式批量處理就不容易出错。

把它變成固定動作

建议在每次栏目調整、域名變更、批量下线頁面之後,固定做一次這两個文件的核對,並把结果记在运营筆记里。文件不大,改一次只要几分钟,省下的却是後續反复排查抓取異常的時間。