网站收录

内容下架、合并或改版后,索引里的老 URL 怎么收尾

内容有生命周期,栏目调整、产品下架、文章合并、站点改版都会留下一批不再需要的 URL。处理完前端不等于结束,索引里的记录还会继续存在。本文按保留、合并、换地址、彻底下线四种去向,讲清各自该用什么方式收尾,以及处理后还需要检查哪些地方。

网站收录

内容下架、合并或改版后,索引里的老 URL 怎么收尾

内容是有生命周期的。栏目调整、产品下架、文章合并、站点改版,都会产生一批"不再需要"的 URL。很多人改完前端模板就以为结束了,其实搜索引擎索引里那条记录还在,甚至继续带来零散访问。老 URL 怎么收尾,取决于这个地址之后还会不会存在。

先分清四种去向

处理之前,先把这批 URL 分个类,因为不同去向对应的做法完全不同:

  • 继续保留,只是不再更新;
  • 内容并入另一个页面,源页面不再单独存在;
  • 换个地址继续存在,比如改版、换目录、换域名;
  • 彻底不要了,没有承接对象。

分类清楚了,后面的动作才不容易做反。

保留但不再更新:地址就别动

如果页面还有长尾搜索价值,最省事的做法是保持 URL 不变。内容过时,可以在页面顶部加一句说明,或者补充最新信息、标注更新日期,而不是为了"看起来新"去改地址或调结构。已经积累了一段时间的页面,换地址带来的损失通常大于那点新鲜感。

内容并入他页:先合并,再处理地址

合并最容易做错的地方,是只把源页面改成一句"本文已合并至某页"。对用户和对搜索引擎来说,这都接近空页面。更稳妥的顺序是:

  1. 把源页面里仍然有效的信息,真正搬进目标页,而不是复制粘贴两份;
  2. 确认目标页能回答源页面原本覆盖的查询;
  3. 源地址做一次性的 301 指向目标页;
  4. 把导航、正文内链、站点地图里指向源地址的链接改成目标页。
301 的意思不是"这个内容不重要",而是"这个地址以后请看那个"。如果内容本身没有真的合并过去,跳转只是把一个空壳指到另一个页面。

内容换地址:一对一 301

换目录、换域名的时候,尽量做一对一的 301。把所有旧 URL 统一跳到首页,会让搜索引擎难以判断每个页面原来的主题,也很容易把之前积累的信号稀释掉。另外,跨地址迁移优先用 301,而不是用 canonical 代替跳转——canonical 是建议,301 是明确的地址变更。

彻底不要了:404、410 和 noindex 怎么选

  • 404:最标准的做法,表示页面不存在,适合没有承接对象的 URL;
  • 410:明确告知已永久删除,部分引擎处理上会更直接,但不必强求;
  • noindex:适合内容还想让人看到、只是不希望进索引的页面,比如活动结束页、临时说明页;
  • 保留一个 200 状态的"已下架"空页面:一般不建议,容易被当成薄内容,也占着索引位置。

这里有个常见误解:用 robots.txt 屏蔽抓取,并不等于从索引里移除。已经收录的地址,可能仍然会出现在结果里,只是缺少摘要。想让它从索引里出去,noindex 通常更直接。

处理完之后,还要检查这几处

  • 更新站点地图,把已处理的 URL 删掉或替换;
  • 站内搜索一下旧地址,看还有没有残留链接;
  • 给搜索引擎留出处理时间,索引状态不是实时同步的;
  • 别反复改主意,今天 301、明天 404,只会拖慢整个处理过程。

几个反复出现的坑

  • 把成百上千个不相关的旧页面批量 301 到首页;
  • 做了 301,但站内链接没改,用户还是从旧地址点进去;
  • 用前端 JS 跳转代替服务器端 301,抓取时看到的状态码仍是 200;
  • 已经返回 410 的页面,又在别处被大量链接指向。

老 URL 的收尾,本质上就是把"这个地址以后代表什么"讲清楚:代表自己、代表另一个页面,还是不再代表任何东西。讲清楚了,剩下的交给时间,不需要额外动作。