交接没做好,蜘蛛会卡在旧地址上
站点改版时最容易出问题的,往往不是新页面上线,而是蜘蛛还在按老地图走。旧 URL 仍然返回内容、内链还指着老地址、Sitemap 里依旧是旧清单,蜘蛛自然没有理由去抓新地址。等到旧地址某天一起下线,抓取量出现断层,再恢复就要花不少时间。
把改版当成一次“抓取交接”来安排,思路会清楚很多:让新地址尽早可发现,让旧地址平稳退出,中间别出现断档。
新地址要先能被走到
新 URL 上线不代表蜘蛛知道它存在,至少要让它在三个地方出现:
- 内链:导航、面包屑、列表页、相关阅读,这些是蜘蛛日常走的路线,改版后要第一时间指向新地址。
- Sitemap:更新为新地址,并保留准确的 lastmod,别让新旧地址长期混在同一份清单里。
- 可点击的普通链接:避免只用 JS 事件或按钮跳转,蜘蛛可能拿不到目标地址。
判断标准很简单:在浏览器里禁用 JS,还能不能从首页一路点到新页面。能,基本就没问题。
旧地址要留一条明确的路
旧 URL 有两种常见处理方式,效果差别很大:
- 301 永久跳转:一对一指到最相关的新页面,蜘蛛顺着跳转就能把新地址记下来。
- 直接 404 或 410:适合确实没有对应内容的页面,但如果大量有内容的页面同时消失,抓取会明显收缩。
跳转链不要拉长,旧地址一跳到位即可。改版期间常见的错误是旧地址先跳到中间页,中间页再跳一次,链条一长,蜘蛛走到一半放弃的情况就会变多。
旧地址保留多久
没有统一答案,但可以从日志判断:当旧地址的抓取请求明显减少,新地址开始稳定出现在抓取日志里,再考虑逐步清理跳转。改版当天就把旧地址全部 404,通常是最差的时机。
分批上线比一次切干净更安全
如果站点规模不小,按目录分批切换会更可控。一次换一个栏目,观察该栏目的新 URL 是否开始被抓、旧 URL 是否还有大量请求。好处是出问题时影响范围有限,回滚也容易。
过程中盯几个信号:
- 新 URL 在日志里的出现频次是否在上升;
- 旧 URL 的抓取是否在缓慢下降,而不是突然归零;
- 跳转是否稳定返回 301,而不是夹着 302、meta refresh 或 JS 跳转;
- 服务器是否出现 5xx、连接中断或超时。
服务器这关别掉链子
改版往往伴随模板调整、缓存重建、CDN 规则变更,这段时间服务器更容易抖。蜘蛛对失败很敏感,一次超时或 5xx 就够让它下次放慢脚步。改版窗口尽量避开业务高峰,并提前确认新模板的响应时间没有明显变长。
另外留意 CDN 与 robots.txt:新目录如果被规则误拦,或者 CDN 还在返回旧缓存页面,蜘蛛看到的和你看到的就不是同一个站,排查起来会很费劲。
改完之后怎么确认交接完成
不必天天盯,按周对比日志就够用:新 URL 的抓取占比是否在提高、旧 URL 是否还有非跳转的直接请求、Sitemap 里的地址与线上实际地址是否一致、内链中是否还残留旧地址。这四项对上了,基本说明交接完成。
改版本身不会让人掉排名,交接没做干净才会。把新地址的发现路径、旧地址的退出路径和服务器稳定性这三件事理顺,剩下的交给时间。