站点改版上线后,收录不会在同一时间整体切换。旧地址可能还留在索引里,新地址刚被爬虫发现,重定向链路上又夹着几跳中转。这个阶段最常见的问题不是“掉了多少收录”,而是新旧版本在同一个索引里并存,谁也说不清哪个才算正式版本。把过渡期当成一个需要单独管理的阶段,比反复提交、反复改指令更有用。
先分清三件事:抓取、收录与展示版本
很多排查之所以绕圈,是因为把三件事混在一起看。
- 抓取:爬虫是否请求到了 200 状态的正式地址。这是前提,不是结果。
- 收录:地址进入索引,并且与某个内容版本绑定。
- 展示版本:搜索结果里最终出现的 URL、标题与摘要。它可能滞后于索引状态。
改版期间,旧地址仍被收录、新地址尚未收录,属于正常过渡;真正需要处理的是长期并存和指向混乱。
上线前:把 URL 映射表做实
过渡期的混乱,多数在上线前就埋下了。建议在切流之前完成一份可核对的映射表:
- 逐条列出旧 URL 到新 URL 的映射,确认是一对一,而不是一对多或多对一。
- 把参数页、分页、筛选页单独归入“保留 / 合并 / 下线”三类,不要默认全部重定向到详情页。
- 确认新站导航、面包屑、正文内链使用的是新地址,而不是仍然经过跳转的旧地址。
- 准备新的 sitemap,同时明确旧 sitemap 的替换时间。
上线后:按三条线分别核对
一、旧 URL 的重定向状态
逐类抽查旧地址的返回状态:是否直接 301 到对应的新页面,是否存在 A 跳 B、B 跳 C 的多跳链路。多跳会削弱传递效果,也拖慢更新节奏。另外,不要把所有旧地址统一跳到首页,这在搜素引擎看来更像软 404,而不是迁移。内容确实不再提供的页面,直接返回 404 或 410 反而更清晰。
二、新 URL 的可抓取性
新站上线后第一件要确认的事,是新地址本身能不能被抓到:
- robots.txt 是否误屏蔽了新目录或新域名。
- 服务器是否还保留着测试环境的访问限制。
- 新页面的 canonical 是否指向自己,而不是旧地址。
- 页面初始 HTML 中是否已包含正文与内链,避免依赖脚本渲染后才出现。
三、索引中的并存状态
过渡期看到新旧地址同时存在,不必立刻下结论。可以借助站点地图、抓取日志与后台报告交叉核对,观察旧地址是否在持续减少、新地址是否在持续增加。这个比例变化通常以周为单位,几天内的波动说明不了什么。
容易被忽略的几个点
- 旧页面残留的 meta noindex 或 X-Robots-Tag 没有被清理,与新站的收录指令相互矛盾。
- hreflang、分页的 rel 关系仍指向旧地址。
- 内链虽然能跳转,但写的还是旧地址,导致爬虫反复经过重定向。
- CDN 或缓存层返回的是改版前的旧页面副本。
- 只更新了 sitemap,却没有同步更新导航与栏目入口。
收录状态的切换速度,主要取决于抓取频次与页面自身的价值,并不由提交动作直接决定。过渡期能做的,是把信号统一,而不是反复催促。
什么时候可以认为过渡收尾
给自己定一个可核对的收尾标准:旧 URL 全部返回预期的 301 或 410;新 URL 可稳定抓取且 canonical 自指;内链与 sitemap 指向一致;索引中新旧版本的比例逐步收敛。四项都满足后,再回到常规的收录监控即可,不必长期停留在改版的临时处理逻辑里。