robots.txt 往往是最早被建立、也最久没被打開過的文件之一。它只有几行,很多人寫完就忘了,直到某天發現蜘蛛来得越来越少,才回头翻出這條規則。定期自查這份文件,成本很低,但能避開一些代價不小的失誤。
先確認它想表達什么
打開文件时別急着看语法,先問一句:這份文件現在的意图,和站点目前的目标一致吗。測試期的全局屏蔽、临时下线的栏目、已经废弃的目錄規則,都可能還留在里面,用戶看不到任何異常,蜘蛛却會照着执行。
几個高频問题
上线後忘记删掉全局屏蔽
開發环境里常见的寫法是禁止一切抓取,站点上线时如果忘了刪除,蜘蛛進来第一眼就會离開。這類規則通常放在文件最前面,自查时先看头几行有没有针對整站的禁止声明。
顺手屏蔽了样式與脚本文件
有些模板會集中屏蔽静態资源目錄,本意是减少抓取量,但這會让渲染环节拿不到頁面样式,影响對頁面结构的判断。样式、脚本這類渲染必需的资源,一般建议保持可抓取。
Sitemap 地址寫错或位置不對
- 地址是否可訪問,返回狀態是否正常;
- 是否指向最新的站点地图入口,而不是几個月前的舊文件;
- 如果站点有多個子域或語言版本,是否只声明了其中一個。
另外,robots.txt 只對根目錄生效,放在子目錄里通常不會被讀取。改域名、換目錄之後,這條也要重新確認。
可执行的自查清單
- 逐行讀一遍,確認每條規則對應的目錄真實存在且仍需限制;
- 检查是否有针對整站的禁止声明,以及它是不是临时規則;
- 確認 CSS、JS、图片等渲染资源没有被誤挡;
- 检查通配符與结尾符号的使用是否符合预期,避免范围比想象中更大;
- 核對 Sitemap 地址拼寫與實际位置;
- 確認文件本身返回正常狀態,而不是错誤頁;
- 把這次检查的结论和日期记下来,方便下次比對。
改完之後怎么驗證
改完不要只看文件内容,最好用搜尋引擎提供的抓取測試工具跑一遍關键地址,看结果是否符合预期。之後几天留意思维日誌里的蜘蛛訪問记錄,观察被挡住的目錄請求是否還在出現,以此確認規則已经生效。
robots.txt 是抓取建议,不是訪問控制手段,也不代表被寫的地址就不會出現在结果里。真正的權限問题要靠登入校驗来解决。
這份文件不需要频繁改動,但值得在结构大調整、域名迁移、栏目上下线之後重新看一眼。把它当成一次两分钟的例行检查,比事後排查抓取異常要轻松得多。