网站收录

页面删除之后:让旧 URL 从索引里退场的顺序与常用手段

页面删除、栏目合并之后,旧 URL 不会自动从索引中消失。本文按内容迁移、永久移除、暂时屏蔽、重复合并四类情况,梳理 301、410、noindex、canonical 的适用场景与常见踩坑组合,并说明站内链接与站点地图需要同步清理的位置。

网站收录

页面删除之后:让旧 URL 从索引里退场的顺序与常用手段

内容下架、商品停产、活动结束、栏目合并,这些动作在后台几分钟就能完成,但搜索引擎索引里的旧 URL 不会跟着立刻消失。处理不当会出现两种尴尬:该退场的页面长期挂在索引里,或者有价值的老页面被一刀切掉,连带损失已有的访问入口。

更常见的麻烦是几种手段的先后顺序用错了,比如给一个已经做了 301 的页面再挂 noindex,或者在 robots.txt 里屏蔽了目录又指望 noindex 生效。下面按先分类、再选手段、最后清理线索的顺序说。

第一步:先分清这是哪一类下架

  • 内容换了新地址,旧页面本身还有访问价值,属于迁移。
  • 内容彻底不要了,未来也不会恢复,属于移除。
  • 页面还留着,只是不想让它出现在搜索结果里,属于屏蔽。
  • 几个页面其实是同一份内容,需要保留一个规范版本,属于合并。

归类不同,后面的手段完全不同。最常见的错误是把暂时下架当成永久删除处理,等业务要恢复时又得从零开始积累。

第二步:四种手段各自适合什么场景

301 重定向:内容还在,只是换了 URL

永久重定向适合页面迁移。指向的应该是主题最接近的那一页,而不是一律跳首页——大批不相关的 URL 都跳到首页,容易被判定为软 404。迁移完成后,原 URL 不需要再保留任何内容。

410 与 404:确认不再需要这个地址

410 表示永久删除,语义比 404 更明确,抓取工具处理起来通常更干脆。404 同样能用,但如果一个 URL 长期返回 404,蜘蛛的访问频率会逐渐降低。关键是服务器要真的返回对应状态码,而不是返回 200 再显示一句「内容不存在」,这类软 404 页面容易长期滞留在索引里。

noindex:页面保留,但不想被索引

noindex 只对能被抓取的页面生效。如果这个 URL 同时被 robots.txt 屏蔽,蜘蛛拿不到页面内容,也就看不到 noindex 标签,标签会一直不生效。想用 noindex,就要保证蜘蛛能正常访问到这一页。

canonical:并入另一个页面

两个页面内容高度重合时,保留一个作为规范版本,另一个用 canonical 指过去。要注意 canonical 是提示而非强制指令,两边内容差异较大时可能被忽略,最终由搜索引擎自行判断。

第三步:几个容易踩坑的组合

  1. 301 和 noindex 同时加。做了 301 之后,蜘蛛不再解析原 URL 的内容,noindex 基本没有意义;反过来,如果重定向的目标页带 noindex,等于把信号送进一个不进索引的页面。
  2. robots.txt 屏蔽加 noindex。两者一起用会互相抵消,前面已经说过原因。
  3. 删掉内容但保留 200 空页。这类页面既不传递价值,也不主动退场,往往在索引里停留很久。
  4. 只删页面不删内链。站内导航、相关推荐、站点地图里还留着旧 URL,蜘蛛会反复抓取,白白消耗抓取资源。

第四步:把站内线索一起清理

  • 站点地图里移除已删除的 URL,别让它继续把蜘蛛引过去。
  • 内链、面包屑、相关推荐改成指向新地址或就近的上级栏目。
  • 目录整体下线时,同步检查 robots.txt 与 CDN 缓存规则,避免缓存里还留着旧页面。
  • 处理完成后,用站点的抓取日志确认这些 URL 的访问频率是否在下降。

多久能生效

索引移除是异步的,没有固定时间表,也不存在提交之后就一定按预期变化的保证。可以观察两点:抓取日志里这些 URL 是否还在被频繁访问,以及索引报告里对应条目的数量变化。真正影响快慢的,是页面是否还被站内其他位置引用、站外是否还有链接指向它——只要入口还在,蜘蛛就会一直找过来。

动手之前先问一句:这个 URL 上积累的访问和链接,新的落点在哪里?如果答案是「没有」,那就干脆地让它退出;如果有,就把重定向指向最合适的那一页。