網站收錄

站点改版後的收錄過渡:舊 URL、重定向與新頁面的核對清單

站点改版上线後,收錄不會在同一時間整体切換,舊地址與新地址常常在一個索引里並存。本文整理過渡期的核對顺序:先做實 URL 映射表,再從重定向、新頁可抓取性、索引並存狀態三條线分別检查,並列出 canonical、内鏈、sitemap 等常见遗漏点,帮助判断過渡是否收尾。

網站收錄

站点改版後的收錄過渡:舊 URL、重定向與新頁面的核對清單

站点改版上线後,收錄不會在同一時間整体切換。舊地址可能還留在索引里,新地址刚被爬虫發現,重定向鏈路上又夹着几跳中轉。這個阶段最常见的問题不是“掉了多少收錄”,而是新舊版本在同一個索引里並存,谁也说不清哪個才算正式版本。把過渡期当成一個需要單獨管理的阶段,比反复提交、反复改指令更有用。

先分清三件事:抓取、收錄與展示版本

很多排查之所以绕圈,是因為把三件事混在一起看。

  • 抓取:爬虫是否請求到了 200 狀態的正式地址。這是前提,不是结果。
  • 收錄:地址進入索引,並且與某個内容版本绑定。
  • 展示版本:搜尋结果里最终出現的 URL、标题與摘要。它可能滞後于索引狀態。

改版期間,舊地址仍被收錄、新地址尚未收錄,属于正常過渡;真正需要處理的是長期並存和指向混乱。

上线前:把 URL 映射表做實

過渡期的混乱,多數在上线前就埋下了。建议在切流之前完成一份可核對的映射表:

  1. 逐條列出舊 URL 到新 URL 的映射,確認是一對一,而不是一對多或多對一。
  2. 把參數頁、分頁、篩選頁單獨归入“保留 / 合並 / 下线”三類,不要預設全部重定向到詳情頁。
  3. 確認新站導航、面包屑、正文内鏈使用的是新地址,而不是仍然经過跳轉的舊地址。
  4. 准备新的 sitemap,同时明确舊 sitemap 的替換時間。

上线後:按三條线分別核對

一、舊 URL 的重定向狀態

逐類抽查舊地址的返回狀態:是否直接 301 到對應的新頁面,是否存在 A 跳 B、B 跳 C 的多跳鏈路。多跳會削弱传递效果,也拖慢更新节奏。另外,不要把所有舊地址统一跳到首頁,這在搜素引擎看来更像软 404,而不是迁移。内容确實不再提供的頁面,直接返回 404 或 410 反而更清晰。

二、新 URL 的可抓取性

新站上线後第一件要確認的事,是新地址本身能不能被抓到:

  • robots.txt 是否誤屏蔽了新目錄或新域名。
  • 服務器是否還保留着測試环境的訪問限制。
  • 新頁面的 canonical 是否指向自己,而不是舊地址。
  • 頁面初始 HTML 中是否已包含正文與内鏈,避免依赖脚本渲染後才出現。

三、索引中的並存狀態

過渡期看到新舊地址同时存在,不必立刻下结论。可以借助站点地图、抓取日誌與後台报告交叉核對,观察舊地址是否在持續减少、新地址是否在持續增加。這個比例變化通常以周為單位,几天内的波動說明不了什么。

容易被忽略的几個点

  • 舊頁面残留的 meta noindex 或 X-Robots-Tag 没有被清理,與新站的收錄指令相互矛盾。
  • hreflang、分頁的 rel 關系仍指向舊地址。
  • 内鏈虽然能跳轉,但寫的還是舊地址,導致爬虫反复经過重定向。
  • CDN 或缓存层返回的是改版前的舊頁面副本。
  • 只更新了 sitemap,却没有同步更新導航與栏目入口。
收錄狀態的切換速度,主要取决于抓取频次與頁面自身的價值,並不由提交動作直接决定。過渡期能做的,是把信号统一,而不是反复催促。

什么时候可以認為過渡收尾

给自己定一個可核對的收尾标准:舊 URL 全部返回预期的 301 或 410;新 URL 可稳定抓取且 canonical 自指;内鏈與 sitemap 指向一致;索引中新舊版本的比例逐步收敛。四項都满足後,再回到常規的收錄监控即可,不必長期停留在改版的临时處理逻辑里。