因为改版、测试或者临时控流,站点经常会先用 robots.txt 屏蔽掉一批 URL,等事情处理完再放开。放开只是第一步,被屏蔽过的地址往往不会马上回到抓取队列,索引也不会自动补上。下面按顺序梳理一遍需要核对的地方。
一、先确认屏蔽是真的解除了
放开后第一件事不是急着看收录,而是回到 robots.txt 本身,确认规则确实已经不再挡住目标地址。
- 是否还有残余规则:路径前缀、通配符、结尾锚定,都可能让同一批 URL 依然被挡住。
- 是否换了主机:robots.txt 按主机分开生效,主站放开不代表图片域、静态资源域也放开了。
- 文件本身能否正常访问:robots.txt 返回 200 且内容完整,不要出现 5xx 或者空白文件。
- 用站长工具里的 robots.txt 测试功能,对具体 URL 逐条验证,而不是只看规则文字。
搜索引擎对 robots.txt 有缓存,通常以小时到一天计,个别情况下更久。改完之后不要来回反复调整,频繁改动会让后续的抓取表现更难判断。
二、被屏蔽期间,页面上的指令其实是“隐身”的
robots.txt 挡住的 URL 不会被抓取,页面里的 meta noindex、canonical 这些信号也就没有机会被读到。这意味着两件事:屏蔽期间页面没有进索引,原因只是“没被抓”,并不代表页面本身合格;放开之后,页面会先被当成一个接近全新的 URL 走一遍流程,页面上原本存在的 noindex 或者指向别处的 canonical 才会开始起作用。
所以放开之前,先回到页面本身确认:该留的留,该挡的挡。临时测试页、站内搜索结果页、重复筛选页,如果本来就不想被收录,不要指望 robots.txt,直接上 meta noindex 更明确。反过来,希望被收录的页面,要检查有没有残留的 noindex、X-Robots-Tag 响应头,或者指向其他地址的 canonical。
三、把发现路径补回来
屏蔽解除只代表“可以抓”,不代表“会被发现”。被挡住的那段时间,很多入口可能已经失效或者不再更新,放开后需要把这些 URL 重新放回可发现的位置。
- sitemap:确认目标 URL 在同域的 sitemap 里。如果屏蔽期间就把地址放进去,可能会收到“已被 robots.txt 屏蔽”的提示,这属于预期情况;放开后再核验一次,避免提交的是失效地址,并让 lastmod 反映最近一次实质改动。
- 站内链接:检查这些页面有没有正常的站内入口。只有 sitemap、没有任何内链的页面,抓取优先级通常偏低,深层目录尤其明显。
- 旧地址与新地址的关系:如果同一批内容换过 URL,先确认跳转是 301 且指向明确,不要留一串跳转链。
- 提交通道:对于确实重要、数量又不大的页面,可以通过站长工具逐个或小批量提交,作为补充手段,而不是主要依赖。
四、量大就分批放开
如果屏蔽的是成百上千个 URL,一次性全部放开,抓取量会在短时间内集中到这些地址上,日志里可能出现大量 200,反而来不及细看。更稳妥的做法是按目录或模板分批处理。
- 先放开一小部分代表性页面,不同类型的模板各挑几个。
- 观察日志里这些地址的抓取频次和状态码,确认是不是真的在被抓。
- 确认没有大面积 404、5xx 或者重定向问题后,再放开下一批。
- 每批之间留出足够的观察间隔,不要一天放一批。
五、观察窗口里重点看什么
- 抓取是否真的发生:日志里能查到对应 URL 的访问记录,状态码以 200 为主。
- 页面自我认定的规范地址:如果放开后页面指向了别的 URL,索引里出现的可能是另一个地址。
- 索引状态的变化:从“已被 robots.txt 屏蔽”到“已发现”“已抓取”,每一步都需要时间,通常以周计。
- 有没有收录后又消失:常见原因是内容与其他页面高度重复,或者被更明确的规范页面取代。
- 质量与重复:放开之前没处理好的参数页、薄内容页,放开后一样可能被拒收,还会影响同一目录下的判断。
robots.txt 放开只是把门打开。门后的页面能不能走完发现、抓取、索引这条链路,还是要看它自身有没有值得收录的内容,以及有没有足够清晰的入口。
最后提醒一句:robots.txt 是用来管理抓取的,不是用来管理收录的。想让页面不进索引,用 noindex;想让页面进索引,就别在 robots.txt 里挡着它。