搜尋抓取

内容下线與归档:老 URL 的發現入口该怎么收

内容下线之後,舊 URL 的内鏈、Sitemap 记錄和外鏈仍在提醒搜尋蜘蛛来訪。本文按永久刪除、内容合並、保留归档三種情况,梳理狀態碼、跳轉、内鏈清理與 Sitemap 更新的核對顺序,帮站点把發現入口和内容狀態對齐,减少空壳地址占用抓取机會。

搜尋抓取

内容下线與归档:老 URL 的發現入口该怎么收

站点做久了,總會有内容需要下线:活動頁過期、产品停产、舊版教程被新版取代。下线本身不难,麻烦的是這些頁面的 URL 往往已经积累了内鏈、外鏈和 Sitemap 记錄,搜尋蜘蛛還會按老路径来訪問。如果只是把頁面删掉,發現入口却還留着,抓取就會一直撞在空地址上。

先分清三種下线狀態

處理方式不同,URL 的處置方式也不同。動手前先给每個待下线的地址归個類。

  • 永久刪除:内容不再需要,也没有替代頁面。
  • 内容合並:舊内容被新頁面吸收,舊地址有明确的新去向。
  • 保留归档:内容不再更新,但仍有一定參考價值。

永久刪除:把發現入口一起收掉

頁面删掉只是第一步,真正要清理的是「還能從哪里找到它」。

  • 從 Sitemap 中移除该 URL,否則地图本身還在持續提醒搜尋蜘蛛来訪問。
  • 检查站内導航、列表頁、相關推荐和友情連結里的指向,換成新地址或直接去掉。
  • RSS、接口返回的 JSON、移動端頁面里的連結也顺手看一眼,這些入口容易被忽略。
  • 服務器返回明确的 404 或 410,不要用 200 狀態碼配一個「内容不存在」的提示頁。

外鏈無法控制,也不需要控制。只要站内入口收敛干净,剩下的外鏈訪問會自然衰减。

内容合並:让舊 URL 變成一次干净的跳轉

有明确替代頁面时,用 301 把舊地址指過去,是最省事的做法。注意两点:一是跳轉要一步到位,別舊地址跳中間頁、中間頁再跳新頁,鏈子越長,抓取时消耗的来訪次數越多;二是跳轉目标要和原内容相關,把用戶和搜尋蜘蛛都送到一個不相關的頁面上,等于換了個地方撞空。

跳轉生效後,再把站内指向舊地址的連結逐步改成新地址。跳轉是兜底,内鏈才是常態入口。

保留归档:让它仍然值得被訪問

归档頁最容易做成空壳:标题還在,正文只剩一句「该内容已归档」。這種頁面能被發現,却拿不到有效内容,長期看只是占用抓取机會。

  • 保留原文核心信息或摘要,至少让頁面有獨立可讀的内容。
  • 在明顯位置给出指向現行版本的連結,形成新的抓取路径。
  • 标注归档狀態和最後更新時間,避免被当成仍在维護的頁面。
  • 如果同批归档頁面數量很大,可以考虑统一放在一個归档目錄下,並在 Sitemap 中單獨分组,方便後續观察。

一個可执行的核對顺序

  1. 列出待下线 URL 清單,标注属于刪除、合並還是归档。
  2. 先處理跳轉和狀態碼,保證訪問行為符合预期。
  3. 再清理站内連結入口,包括導航、列表、推荐位和 Sitemap。
  4. 归档頁补齐正文與指向新内容的連結。
  5. 观察一段時間的服務器日誌,看這些地址的訪問量是否在下降,是否還有来源不明的持續点击。

容易忽略的两處

一是分頁和篩選參數:一批商品下架後,带參數的列表 URL 可能仍然可訪問,内容是空的。二是站点地图的 lastmod,刪除或归档後要同步更新,否則地图给出的時間信号和實际狀態不一致。

下线不是把文件删掉就結束了,而是要让「發現路径」跟着内容一起收敛。入口留着,抓取就會持續,消耗的是本该分配给新頁面的来訪次數。

最後提醒一点:這些操作能改善站点的抓取结构,但不等于舊地址會立刻從搜尋结果里消失,也不意味着新頁面一定會被抓取。把结构理顺、把狀態碼寫對,剩下的交给時間和持續的内容更新。