搜索抓取

改版上线后,怎么把蜘蛛从旧 URL 引到新路径

站点改版常伴随 URL 结构变化,而蜘蛛手里还留着旧地址。本文讲改版前后该做的三件事:整理新旧 URL 对应关系、用跳转和 Sitemap 把路径接上、再通过服务器日志确认蜘蛛有没有走到新地址,并附一份可照着做的自查清单。

搜索抓取

改版上线后,怎么把蜘蛛从旧 URL 引到新路径

改版为什么会让抓取路径中断

蜘蛛记的是 URL,不是页面。改版时如果地址变了、栏目结构变了、内链没跟着换,蜘蛛顺着旧链接走下来就会撞上 404,或者停在旧的跳转上。它不会主动猜新地址,只能靠你给出的线索重新找到路。

所以改版这件事,对抓取来说核心只有一句话:让每一条旧路径都有一个明确的出口,指向新路径。

第一步:整理新旧 URL 对应关系

在动手配置跳转之前,先把对应关系列表拉出来,按三类归档:

  • 一对一:旧页面对应新页面,正常 301。
  • 多对一:若干旧页面合并成新页面,都指向同一个目标,注意别形成跳转链。
  • 确定废弃:内容不再保留,跳到最相关的上级栏目,不要一律跳到首页。

一律跳首页的问题是,蜘蛛最后只拿到一个入口,原本分散在各栏目的路径全部塌缩,新页面的发现节奏会明显变慢。

跳转和内链,先做哪个

跳转是给已经知道旧地址的蜘蛛兜底,内链是让蜘蛛以后不用再走旧地址。两件事都要做,顺序上建议这样安排:

  1. 上线时同步配置 301,先保证旧地址不返回 404。
  2. 随后尽快把站内链接、导航、面包屑、Sitemap 换成新地址。
  3. 最后清理残留的旧链接,包括正文里的历史引用、专题页里的老入口。
跳转链每多一跳,蜘蛛愿意继续走完的概率就低一点。旧地址直接跳到最终地址,不要在中间加中转页。

顺手把 Sitemap 更新掉

改版后站点地图应该只保留新地址。旧地址继续留在 Sitemap 里,等于同时递给蜘蛛两套入口,容易让它反复走跳转。如果新地址还没完全稳定,可以先小范围提交,观察一段时间再全量更新。

怎么确认蜘蛛确实换了路径

改版后的一到两周,重点看服务器日志里的三件事:

  • 旧地址的访问量是否在下降,返回的状态码是不是 301 而不是 404;
  • 新地址是否开始出现蜘蛛访问,且请求量逐步上升;
  • 新地址的响应时间是否稳定,别让改版顺手带来性能回退。

如果旧地址持续被大量请求、新地址迟迟没有动静,多半是内链还没换干净,或者跳转配置有遗漏。

一份改版前后自查清单

  1. 新旧 URL 映射表是否完整,有没有遗漏的栏目页和分页地址;
  2. 旧地址返回的是 301,不是 302、JS 跳转或 meta refresh;
  3. 跳转是否直达最终地址,没有多级串联;
  4. 导航、面包屑、正文内链是否已指向新地址;
  5. Sitemap 是否只含新地址,lastmod 是否反映真实更新时间;
  6. robots.txt 是否还挡着已经废弃的旧目录;
  7. 服务器在改版后是否出现 5xx 或超时,影响蜘蛛的重试。

改版不可能一次做到完美,但路径不能断。把旧地址的出口接好、把新地址的入口做足,剩下的交给持续观察就好。