因為改版、測試或者临时控流,站点经常會先用 robots.txt 屏蔽掉一批 URL,等事情處理完再放開。放開只是第一步,被屏蔽過的地址往往不會马上回到抓取队列,索引也不會自動补上。下面按顺序梳理一遍需要核對的地方。
一、先確認屏蔽是真的解除了
放開後第一件事不是急着看收錄,而是回到 robots.txt 本身,確認規則确實已经不再挡住目标地址。
- 是否還有残余規則:路径前缀、通配符、结尾锚定,都可能让同一批 URL 依然被挡住。
- 是否換了主机:robots.txt 按主机分開生效,主站放開不代表图片域、静態资源域也放開了。
- 文件本身能否正常訪問:robots.txt 返回 200 且内容完整,不要出現 5xx 或者空白文件。
- 用站長工具里的 robots.txt 測試功能,對具体 URL 逐條驗證,而不是只看規則文字。
搜尋引擎對 robots.txt 有缓存,通常以小时到一天計,個別情况下更久。改完之後不要来回反复調整,频繁改動會让後續的抓取表現更难判断。
二、被屏蔽期間,頁面上的指令其實是“隐身”的
robots.txt 挡住的 URL 不會被抓取,頁面里的 meta noindex、canonical 這些信号也就没有机會被讀到。這意味着两件事:屏蔽期間頁面没有進索引,原因只是“没被抓”,並不代表頁面本身合格;放開之後,頁面會先被当成一個接近全新的 URL 走一遍流程,頁面上原本存在的 noindex 或者指向別處的 canonical 才會開始起作用。
所以放開之前,先回到頁面本身確認:该留的留,该挡的挡。临时測試頁、站内搜尋结果頁、重复篩選頁,如果本来就不想被收錄,不要指望 robots.txt,直接上 meta noindex 更明确。反過来,希望被收錄的頁面,要检查有没有残留的 noindex、X-Robots-Tag 响應头,或者指向其他地址的 canonical。
三、把發現路径补回来
屏蔽解除只代表“可以抓”,不代表“會被發現”。被挡住的那段時間,很多入口可能已经失效或者不再更新,放開後需要把這些 URL 重新放回可發現的位置。
- sitemap:確認目标 URL 在同域的 sitemap 里。如果屏蔽期間就把地址放進去,可能會收到“已被 robots.txt 屏蔽”的提示,這属于预期情况;放開後再核驗一次,避免提交的是失效地址,並让 lastmod 反映最近一次實质改動。
- 站内連結:检查這些頁面有没有正常的站内入口。只有 sitemap、没有任何内鏈的頁面,抓取優先級通常偏低,深层目錄尤其明顯。
- 舊地址與新地址的關系:如果同一批内容換過 URL,先確認跳轉是 301 且指向明确,不要留一串跳轉鏈。
- 提交通道:對于确實重要、數量又不大的頁面,可以通過站長工具逐個或小批量提交,作為补充手段,而不是主要依赖。
四、量大就分批放開
如果屏蔽的是成百上千個 URL,一次性全部放開,抓取量會在短時間内集中到這些地址上,日誌里可能出現大量 200,反而来不及细看。更稳妥的做法是按目錄或模板分批處理。
- 先放開一小部分代表性頁面,不同類型的模板各挑几個。
- 观察日誌里這些地址的抓取频次和狀態碼,確認是不是真的在被抓。
- 確認没有大面积 404、5xx 或者重定向問题後,再放開下一批。
- 每批之間留出足够的观察間隔,不要一天放一批。
五、观察窗口里重点看什么
- 抓取是否真的發生:日誌里能查到對應 URL 的訪問记錄,狀態碼以 200 為主。
- 頁面自我認定的規范地址:如果放開後頁面指向了別的 URL,索引里出現的可能是另一個地址。
- 索引狀態的變化:從“已被 robots.txt 屏蔽”到“已發現”“已抓取”,每一步都需要時間,通常以周計。
- 有没有收錄後又消失:常见原因是内容與其他頁面高度重复,或者被更明确的規范頁面取代。
- 质量與重复:放開之前没處理好的參數頁、薄内容頁,放開後一样可能被拒收,還會影响同一目錄下的判断。
robots.txt 放開只是把门打開。门後的頁面能不能走完發現、抓取、索引這條鏈路,還是要看它自身有没有值得收錄的内容,以及有没有足够清晰的入口。
最後提醒一句:robots.txt 是用来管理抓取的,不是用来管理收錄的。想让頁面不進索引,用 noindex;想让頁面進索引,就別在 robots.txt 里挡着它。