網站收錄

頁面下架、合並與刪除:收錄清理该按哪種方式處理

頁面删掉之後,搜尋结果里還挂着原来的记錄,這種時間差是正常的。本文按内容彻底不要、内容搬到新地址、暂时不想被搜到三種情形,分別說明 404、410、301 與 noindex 的适用场景,以及内鏈和站点地图需要同步核對的地方。

網站收錄

頁面下架、合並與刪除:收錄清理该按哪種方式處理

收錄是搜尋引擎自己儲存的副本

把頁面删掉,或者把整批内容下架,並不等于索引里的记錄會同步消失。搜尋引擎儲存的是上一次抓取到的结果,它需要在下一次訪問时看到新的狀態,才會更新自己的副本。所以下架動作和收錄清理之間存在時間差,這是正常現象,不必因為隔天還能搜到就反复改動設定。

先判断属于哪種情形

處理方式取决于你想要的结果,而不是頁面本身寫了什么。常见的是三類:

  • 内容彻底不要了:頁面應返回 404 或 410,同时從站点地图和内鏈里拿掉。
  • 内容搬到了新地址:用 301 指向新頁面,並确保新頁面能承接舊頁的完整内容。
  • 暂时不想被搜到,但頁面還要用:比如季节活動頁、临时下线的商品頁。這種情况适合保留 200 狀態碼再加 noindex,等重新開放时再去掉。

301 的用法和容易踩的坑

301 是告诉搜尋引擎這個地址永久換成了另一個,舊頁面积累的信号會向目标頁合並。用得對是一次干净的搬家,用得不干净會留下很長的尾巴。

  • 多個舊頁合並到同一個新頁时,要確認新頁的主题确實能覆盖它們。把不相關的頁面全部指向首頁,通常會被当作無效跳轉處理。
  • 避免鏈式跳轉,比如 A 到 B 再到 C。蜘蛛要多跳几次才能到终点,信号也會在中間损耗,目标地址最好一步到位。
  • 302 表示临时跳轉,長期使用會让搜尋引擎保留對原地址的判断。确實是永久搬家,就不要顺手寫成 302。
  • 跳轉目标頁要返回 200 且内容可訪問。跳到一個 404 或者需要登入的頁面,等于搬到了空地。

404 與 noindex 的顺序問题

两者都能让頁面登出索引,差別在于生效路径。noindex 需要蜘蛛重新抓取並讀到這個标簽之後才起作用;404 則是蜘蛛下次訪問时直接看到资源不存在。對已经收錄、又有一定抓取频率的頁面来说,两者速度差別不會特別大,真正决定快慢的是這個地址被訪問的频率。

批量下架时可以按這個顺序走:先把頁面從導航、列表和站点地图里移除,再决定是直接返回 404,還是先 noindex 過渡一段時間。如果站点改狀態碼的成本很高,或者頁面内容還需要留给内部使用,noindex 過渡更實际;如果這批頁面确定不會再回来,直接 404 更省事,也少一层狀態需要维護。

内容合並时別只做跳轉

合並頁面最容易出的問题是:舊頁上有一部分獨特内容,比如用戶评论、參數表、特殊說明,被 301 直接冲掉了,而新頁並不包含這些信息。對用戶和搜尋引擎来说,這都是内容變少。

更合理的做法是先把舊頁里值得保留的部分迁到新頁,確認新頁结构完整、可正常訪問,再設定 301。内鏈也要同步改:導航、面包屑、正文連結、相關推荐位,凡是還指向舊地址的地方都改成新地址。只要舊地址還被大量内鏈指向,蜘蛛就會反复去訪問它。

下架之後要核對的几個入口

  1. 站点地图里是否還留着已刪除的地址。
  2. 頁面實际返回的狀態碼是否和预期一致,尤其要確認没有出現返回 200 却没有内容的软 404。
  3. 首頁、栏目頁、标簽頁、歷史归档里是否還有指向舊地址的連結。
  4. 站内搜尋、推荐模块、外部投放的落地頁是否還在引用舊 URL。
  5. 訪問日誌里這批地址是否仍有蜘蛛訪問,频率是否在下降。
收錄清理是让搜尋引擎逐步更新認知的過程,不是一次開關。動作發出後,给蜘蛛留出重新抓取的時間,比反复修改狀態碼更有用。

一個简單的判断顺序

先問這個地址以後還要不要,再問内容去了哪里,最後才問用什么方式告诉搜尋引擎。顺序反了,容易在 404、noindex、301 之間来回切換,反而把整個過程拉得更長。