站点运营

站点运营:robots.txt 自查,別让一行規則挡住整站

robots.txt 只有几行,却直接决定蜘蛛能不能進。上线时的全局屏蔽、誤伤的样式脚本、寫错的 Sitemap 地址,都是运营中常见的坑。這篇给出一個可执行的检查顺序,帮你確認這份文件目前的狀態和真實意图一致。

站点运营

站点运营:robots.txt 自查,別让一行規則挡住整站

robots.txt 往往是最早被建立、也最久没被打開過的文件之一。它只有几行,很多人寫完就忘了,直到某天發現蜘蛛来得越来越少,才回头翻出這條規則。定期自查這份文件,成本很低,但能避開一些代價不小的失誤。

先確認它想表達什么

打開文件时別急着看语法,先問一句:這份文件現在的意图,和站点目前的目标一致吗。測試期的全局屏蔽、临时下线的栏目、已经废弃的目錄規則,都可能還留在里面,用戶看不到任何異常,蜘蛛却會照着执行。

几個高频問题

上线後忘记删掉全局屏蔽

開發环境里常见的寫法是禁止一切抓取,站点上线时如果忘了刪除,蜘蛛進来第一眼就會离開。這類規則通常放在文件最前面,自查时先看头几行有没有针對整站的禁止声明。

顺手屏蔽了样式與脚本文件

有些模板會集中屏蔽静態资源目錄,本意是减少抓取量,但這會让渲染环节拿不到頁面样式,影响對頁面结构的判断。样式、脚本這類渲染必需的资源,一般建议保持可抓取。

Sitemap 地址寫错或位置不對

  • 地址是否可訪問,返回狀態是否正常;
  • 是否指向最新的站点地图入口,而不是几個月前的舊文件;
  • 如果站点有多個子域或語言版本,是否只声明了其中一個。

另外,robots.txt 只對根目錄生效,放在子目錄里通常不會被讀取。改域名、換目錄之後,這條也要重新確認。

可执行的自查清單

  1. 逐行讀一遍,確認每條規則對應的目錄真實存在且仍需限制;
  2. 检查是否有针對整站的禁止声明,以及它是不是临时規則;
  3. 確認 CSS、JS、图片等渲染资源没有被誤挡;
  4. 检查通配符與结尾符号的使用是否符合预期,避免范围比想象中更大;
  5. 核對 Sitemap 地址拼寫與實际位置;
  6. 確認文件本身返回正常狀態,而不是错誤頁;
  7. 把這次检查的结论和日期记下来,方便下次比對。

改完之後怎么驗證

改完不要只看文件内容,最好用搜尋引擎提供的抓取測試工具跑一遍關键地址,看结果是否符合预期。之後几天留意思维日誌里的蜘蛛訪問记錄,观察被挡住的目錄請求是否還在出現,以此確認規則已经生效。

robots.txt 是抓取建议,不是訪問控制手段,也不代表被寫的地址就不會出現在结果里。真正的權限問题要靠登入校驗来解决。

這份文件不需要频繁改動,但值得在结构大調整、域名迁移、栏目上下线之後重新看一眼。把它当成一次两分钟的例行检查,比事後排查抓取異常要轻松得多。