網站收錄

頁面刪除之後:让舊 URL 從索引里退场的顺序與常用手段

頁面刪除、栏目合並之後,舊 URL 不會自動從索引中消失。本文按内容迁移、永久移除、暂时屏蔽、重复合並四類情况,梳理 301、410、noindex、canonical 的适用场景與常见踩坑组合,並說明站内連結與站点地图需要同步清理的位置。

網站收錄

頁面刪除之後:让舊 URL 從索引里退场的顺序與常用手段

内容下架、商品停产、活動結束、栏目合並,這些動作在後台几分钟就能完成,但搜尋引擎索引里的舊 URL 不會跟着立刻消失。處理不当會出現两種尴尬:该退场的頁面長期挂在索引里,或者有價值的老頁面被一刀切掉,连带损失已有的訪問入口。

更常见的麻烦是几種手段的先後顺序用错了,比如给一個已经做了 301 的頁面再挂 noindex,或者在 robots.txt 里屏蔽了目錄又指望 noindex 生效。下面按先分類、再選手段、最後清理线索的顺序说。

第一步:先分清這是哪一類下架

  • 内容換了新地址,舊頁面本身還有訪問價值,属于迁移。
  • 内容彻底不要了,未来也不會恢复,属于移除。
  • 頁面還留着,只是不想让它出現在搜尋结果里,属于屏蔽。
  • 几個頁面其實是同一份内容,需要保留一個規范版本,属于合並。

归類不同,後面的手段完全不同。最常见的错誤是把暂时下架当成永久刪除處理,等业務要恢复时又得從零開始积累。

第二步:四種手段各自适合什么场景

301 重定向:内容還在,只是換了 URL

永久重定向适合頁面迁移。指向的應该是主题最接近的那一頁,而不是一律跳首頁——大批不相關的 URL 都跳到首頁,容易被判定為软 404。迁移完成後,原 URL 不需要再保留任何内容。

410 與 404:確認不再需要這個地址

410 表示永久刪除,语义比 404 更明确,抓取工具處理起来通常更干脆。404 同样能用,但如果一個 URL 長期返回 404,蜘蛛的訪問频率會逐渐降低。關键是服務器要真的返回對應狀態碼,而不是返回 200 再顯示一句「内容不存在」,這類软 404 頁面容易長期滞留在索引里。

noindex:頁面保留,但不想被索引

noindex 只對能被抓取的頁面生效。如果這個 URL 同时被 robots.txt 屏蔽,蜘蛛拿不到頁面内容,也就看不到 noindex 标簽,标簽會一直不生效。想用 noindex,就要保證蜘蛛能正常訪問到這一頁。

canonical:並入另一個頁面

两個頁面内容高度重合时,保留一個作為規范版本,另一個用 canonical 指過去。要注意 canonical 是提示而非强制指令,两邊内容差异較大时可能被忽略,最终由搜尋引擎自行判断。

第三步:几個容易踩坑的组合

  1. 301 和 noindex 同时加。做了 301 之後,蜘蛛不再解析原 URL 的内容,noindex 基本没有意义;反過来,如果重定向的目标頁带 noindex,等于把信号送進一個不進索引的頁面。
  2. robots.txt 屏蔽加 noindex。两者一起用會互相抵消,前面已经说過原因。
  3. 删掉内容但保留 200 空頁。這類頁面既不传递價值,也不主動退场,往往在索引里停留很久。
  4. 只删頁面不删内鏈。站内導航、相關推荐、站点地图里還留着舊 URL,蜘蛛會反复抓取,白白消耗抓取资源。

第四步:把站内线索一起清理

  • 站点地图里移除已刪除的 URL,別让它繼續把蜘蛛引過去。
  • 内鏈、面包屑、相關推荐改成指向新地址或就近的上級栏目。
  • 目錄整体下线时,同步检查 robots.txt 與 CDN 缓存規則,避免缓存里還留着舊頁面。
  • 處理完成後,用站点的抓取日誌確認這些 URL 的訪問频率是否在下降。

多久能生效

索引移除是异步的,没有固定時間表,也不存在提交之後就一定按预期變化的保證。可以观察两点:抓取日誌里這些 URL 是否還在被频繁訪問,以及索引报告里對應條目的數量變化。真正影响快慢的,是頁面是否還被站内其他位置引用、站外是否還有連結指向它——只要入口還在,蜘蛛就會一直找過来。

動手之前先問一句:這個 URL 上积累的訪問和連結,新的落点在哪里?如果答案是「没有」,那就干脆地让它登出;如果有,就把重定向指向最合适的那一頁。