改版时顺手把 URL 结构一起换掉,是最容易引起收录波动的操作之一。收录量下滑不等于被惩罚,更常见的原因是老地址的交接没做完、新地址还没被有效发现。与其盯着总量焦虑,不如按顺序把交接链路核对一遍。
一、先确认这次到底改了什么
只改路径、换域名、换协议、改动参数规则,对收录的影响完全不同,先分清类型再谈处理方式。
- 只改路径:老地址 301 到新地址即可,信号可以传递,处理相对简单。
- 换域名:两套站点同时可访问,容易出现重复内容和新老混杂。
- 协议切换:http 换 https 时,注意内链、图片、站内搜索里是否还残留 http 版本。
- 参数规则改动:可能生成一批新的 URL 变体,需要重新决定哪些该被收录、哪些该收敛。
二、老地址到新地址,最好一跳到位
逐层跳转会让爬虫多花时间,也增加中途失败的概率。把 a→b→c 压成 a→c,同时检查这几点:
- 老地址返回 301 而不是 302,跳转目标页返回 200。
- 跳转目标是对应内容的新地址,而不是统一丢到首页。
- 不要用 JavaScript 跳转或 meta refresh 代替服务端重定向。
- 跳转链里不要出现循环,也不要跳到已经不存在的页面。
如果老地址已经返回 404,或者老目录被 robots.txt 整体屏蔽,之前在这个地址上积累的信号就很难再传过去。
三、新地址要被发现,入口得给够
导航与内链
站内导航、面包屑、相关推荐、栏目列表里的链接是否已经指向新地址,而不是还停在老地址上。内链仍然是爬虫发现新页面的主要途径,只改 sitemap 不改内链,效果有限。
Sitemap 与提交
更新 sitemap 时不要只留新地址就算完事,网页版 sitemap 要与实际可访问的地址一致,避免里面还混着已经不返回 200 的老地址。
站内搜索与外部链接
站内搜索结果、旧的外部链接、合作方页面上的链接,往往会在很长一段时间里继续指向老地址。这些入口反而能帮你把爬虫带到新地址,前提是重定向还在正常工作。
四、把信号调到一致
- canonical 指向最终的新地址,不要一边 301 一边 canonical 指向老地址。
- 页面上不再出现老地址的可见文字链接,包括页脚和版权区。
- 结构化数据、分享按钮、图片与静态资源地址都换成新域名。
- 不要一边做 301,一边在 robots.txt 里屏蔽老目录,两套指令互相打架。
五、观察时把三个口径分开看
抓取日志看新地址有没有被抓、抓了多少次;索引报告看哪些新地址已经进入索引;site: 查询只能粗略看总量。三者对不上是常态,先看趋势方向,再看具体页面,不要因为某天数字下降就立刻改规则。
六、几个常见的坑
- 过渡期同时上线两套可访问的地址,老站没有做重定向,形成重复内容。
- 老地址 301 到新地址,新地址的 canonical 又指回老地址。
- 只更新了 sitemap,导航和正文内链还全是老地址。
- 上线当天服务器频繁返回 503,或临时加了全站 robots 屏蔽,抓取直接被挡在门外。
七、过渡期怎么安排
建议老地址的 301 至少保留数月,等新地址的抓取趋于稳定、索引量回升之后再考虑清理。清理前先确认没有重要的外部链接还在指向老地址。整个过程不必频繁改动规则,按上面的顺序逐项核对完,再观察日志和索引报告的变化即可。