搜索抓取

内容下线与归档:老 URL 的发现入口该怎么收

内容下线之后,旧 URL 的内链、Sitemap 记录和外链仍在提醒搜索蜘蛛来访。本文按永久删除、内容合并、保留归档三种情况,梳理状态码、跳转、内链清理与 Sitemap 更新的核对顺序,帮站点把发现入口和内容状态对齐,减少空壳地址占用抓取机会。

搜索抓取

内容下线与归档:老 URL 的发现入口该怎么收

站点做久了,总会有内容需要下线:活动页过期、产品停产、旧版教程被新版取代。下线本身不难,麻烦的是这些页面的 URL 往往已经积累了内链、外链和 Sitemap 记录,搜索蜘蛛还会按老路径来访问。如果只是把页面删掉,发现入口却还留着,抓取就会一直撞在空地址上。

先分清三种下线状态

处理方式不同,URL 的处置方式也不同。动手前先给每个待下线的地址归个类。

  • 永久删除:内容不再需要,也没有替代页面。
  • 内容合并:旧内容被新页面吸收,旧地址有明确的新去向。
  • 保留归档:内容不再更新,但仍有一定参考价值。

永久删除:把发现入口一起收掉

页面删掉只是第一步,真正要清理的是「还能从哪里找到它」。

  • 从 Sitemap 中移除该 URL,否则地图本身还在持续提醒搜索蜘蛛来访问。
  • 检查站内导航、列表页、相关推荐和友情链接里的指向,换成新地址或直接去掉。
  • RSS、接口返回的 JSON、移动端页面里的链接也顺手看一眼,这些入口容易被忽略。
  • 服务器返回明确的 404 或 410,不要用 200 状态码配一个「内容不存在」的提示页。

外链无法控制,也不需要控制。只要站内入口收敛干净,剩下的外链访问会自然衰减。

内容合并:让旧 URL 变成一次干净的跳转

有明确替代页面时,用 301 把旧地址指过去,是最省事的做法。注意两点:一是跳转要一步到位,别旧地址跳中间页、中间页再跳新页,链子越长,抓取时消耗的来访次数越多;二是跳转目标要和原内容相关,把用户和搜索蜘蛛都送到一个不相关的页面上,等于换了个地方撞空。

跳转生效后,再把站内指向旧地址的链接逐步改成新地址。跳转是兜底,内链才是常态入口。

保留归档:让它仍然值得被访问

归档页最容易做成空壳:标题还在,正文只剩一句「该内容已归档」。这种页面能被发现,却拿不到有效内容,长期看只是占用抓取机会。

  • 保留原文核心信息或摘要,至少让页面有独立可读的内容。
  • 在明显位置给出指向现行版本的链接,形成新的抓取路径。
  • 标注归档状态和最后更新时间,避免被当成仍在维护的页面。
  • 如果同批归档页面数量很大,可以考虑统一放在一个归档目录下,并在 Sitemap 中单独分组,方便后续观察。

一个可执行的核对顺序

  1. 列出待下线 URL 清单,标注属于删除、合并还是归档。
  2. 先处理跳转和状态码,保证访问行为符合预期。
  3. 再清理站内链接入口,包括导航、列表、推荐位和 Sitemap。
  4. 归档页补齐正文与指向新内容的链接。
  5. 观察一段时间的服务器日志,看这些地址的访问量是否在下降,是否还有来源不明的持续点击。

容易忽略的两处

一是分页和筛选参数:一批商品下架后,带参数的列表 URL 可能仍然可访问,内容是空的。二是站点地图的 lastmod,删除或归档后要同步更新,否则地图给出的时间信号和实际状态不一致。

下线不是把文件删掉就结束了,而是要让「发现路径」跟着内容一起收敛。入口留着,抓取就会持续,消耗的是本该分配给新页面的来访次数。

最后提醒一点:这些操作能改善站点的抓取结构,但不等于旧地址会立刻从搜索结果里消失,也不意味着新页面一定会被抓取。把结构理顺、把状态码写对,剩下的交给时间和持续的内容更新。