网站收录

已删除页面仍留在索引里:状态码、内链与移除入口的核对顺序

页面下线后,搜索结果里仍能看到旧链接,是运营中常见的困扰。它可能来自三种不同原因:页面真的删了、URL 换了,或者页面还在只是不该被收录。本文按状态码、站内入口与移除入口三个阶段给出核对顺序,帮助先分清问题出在哪一环,再决定动哪里。

网站收录

已删除页面仍留在索引里:状态码、内链与移除入口的核对顺序

内容下线、活动页过期、商品下架,都是站点运营里再普通不过的事。但过一阵子去搜索,旧链接还挂在结果里,点进去要么 404,要么跳到首页。这本身不算异常现象,索引更新有它自己的节奏。真正需要判断的是:这条旧链接属于哪种情形,以及当前该动哪一环。

先分清三种情形

  • 页面确实已经删除,不再需要对外提供任何内容。
  • 页面内容还在,只是换了 URL,比如栏目改版或层级调整。
  • 页面还在原地址,但业务上不希望它继续出现在搜索结果里,例如活动结束、库存清零。

这三种情形的处理方式完全不同。第一种适合让地址明确地不可用;第二种应该用跳转把用户带到新地址;第三种要保留可访问性,同时排除索引。顺序搞反了,往往就是旧链接长期不消失的原因。

状态码是最直接的信号

核查时先看访问结果,而不是先看搜索表现。

  • 404:地址不存在,但语义上偏临时;410 明确表示永久移除,对清理旧链接更清晰。
  • 301:指向新地址,适用于页面迁移,不是删除。
  • 200 加空内容:页面能正常打开,正文却是空的或写着“内容不存在”,这属于软 404,会被当成正常页面处理,旧链接自然不容易退出。
  • 302:临时跳转,不适合用来处理永久性的下线。

站内入口要一起清

即使某条地址已经从索引里消失,只要站内链接还指着它,蜘蛛重新抓到时又会把这条地址带回视野。核对时按顺序过一遍:

  1. 导航、面包屑、侧栏推荐位里是否还有指向旧地址的链接。
  2. 正文里的历史链接是否需要改成新地址,或者直接去掉。
  3. 站点地图里是否还列着这些地址,及时更新。
  4. 站内搜索结果、标签页、归档页是否还在生成这些链接。
  5. 分页序列里是否残留。
  6. 如果是一整批下线,检查后台是否还在自动生成对应的列表入口。

移除入口与 robots 的取舍

有些人第一反应是在 robots.txt 里屏蔽旧目录。这能阻止抓取,但不会让已经进入索引的地址消失,反而可能因为抓不到而看不到状态码或 noindex。想让页面退出索引,通常需要它保持可被抓取,并返回明确的状态码,或者带 noindex。

对于紧急场景,搜索平台一般提供移除工具,但它处理的是“当前不应出现在结果里”的地址,前提是页面确实已经 404、410 或带有 noindex。提交只是请求,不是承诺,最终还是要靠页面本身的状态稳定下来。

robots.txt 屏蔽的是抓取,不是索引;处理已收录地址时,这两件事不要混用。

一个可执行的核对顺序

  1. 列出仍出现在结果里的旧地址,按模板分组,不要一个个看。
  2. 逐个确认访问状态和正文情况,记录它属于删除、改址还是不该收录。
  3. 删除类:确保返回 404 或 410,并清掉站内入口。
  4. 改址类:配置 301 到最相关的新页面,同时更新内链和站点地图。
  5. 不该收录类:保留可访问,加 noindex,并从站点地图中移除。
  6. 提交站点地图,观察一段时间的抓取日志与索引状态变化。
  7. 未清掉的地址单独记录,过一段时间再复核一次。

容易踩的几个坑

  • 用 404 页做跳转,用户看到的是首页,返回码却是 404,信号更乱。
  • 整批页面直接删除,没有保留替代入口,用户和外链都断了。
  • 只改前端路由,服务器仍对所有地址返回 200。
  • 处理完当天就去查,索引更新本身需要时间,短期没变化不代表方向错了。

旧链接在索引里停留一段时间是常态。核查的重点不是“今天有没有消失”,而是每一步的信号是否明确:地址是否真的不可用、新地址是否可被识别、站内是否还在生成旧链接。把这些理顺,剩下的交给时间。