站点改版、目錄調整、URL 结构重寫,這些動作往往一次改動大量地址。對搜尋蜘蛛来说,變化的是它原本记住的那張路径图。如果改版後只更新了頁面本身,没有同步處理入口和跳轉,抓取就會在一段時間里明顯變慢:新地址發現不了,舊地址又被反复回訪。
改版動到的其實是三层
把問题拆開會清楚很多:结构层是 URL 本身變了;入口层是導航、列表、内鏈、sitemap 這些指向;跳轉层是舊地址到新地址的過渡。三层里只改一层,通常就會留下断点——结构改了但入口還指向舊地址,或入口改了却没有做跳轉。重建的顺序,也基本按這三层来。
先让新頁面有稳定的入口
新地址上线後,第一件事是给它安排一條不依赖脚本渲染、不需要登入即可到達的路径。常见的可靠入口包括:
- 主導航與栏目頁,层級不要放得太深;
- 列表頁、聚合頁中的條目連結,指向最终地址而非中轉地址;
- 面包屑回到父級栏目;
- sitemap 中同步寫入新地址。
這里有一個容易被忽略的点:内鏈應该尽量直接寫在最终 URL 上。如果站内大量連結仍指向舊的跳轉地址,蜘蛛每次都要多走一跳,抓取效率會被不必要的跳轉消耗掉。
舊地址不是越留越多,也不是一刀切删掉
舊 URL 的處理要按頁面價值分。有對應新頁面的,做一對一的永久跳轉;内容已下线的,返回明确的 410 或 404;仍在被外部引用的地址可以繼續跳轉,但不要在跳轉鏈里套多层。
需要留意跳轉鏈:A → B → C 這種两跳以上的寫法,會让每一段都产生一次抓取請求。改版时尽量把一個舊地址直接指到最终落点,把鏈條压到一跳,站内連結也不要指向中轉地址。
核對跳轉时按顺序来
- 從站内舊入口出發,记錄每一次跳轉的狀態碼與目标;
- 確認鏈上每一跳都能在一到两跳内落地;
- 检查是否存在跳轉回原地址、或跳轉到 404 的环;
- 抽检外鏈来源指向的舊地址,看是否已正确過渡。
sitemap 與内鏈要同时更新
改版後常见的情况是 sitemap 更新了,内鏈没跟上;或者内鏈改好了,sitemap 里還挂着舊地址。两者指向不一致时,蜘蛛拿到的入口信息就是矛盾的。建议把 sitemap 的生成逻辑和站内連結輸出都指向同一份地址資料,改一次就同步一次,避免手工维護两套清單。
用日誌確認發現是否恢复
改版後的一段時間,服務器日誌是最直接的观察窗口。可以重点看几件事:
- 新地址的首次抓取是否出現,大概在改版後多久;
- 舊地址是否還在被大量回訪,是否集中在跳轉請求上;
- 同一路径是否被反复請求,說明發現环节有重复或循环;
- 抓取时是否出現集中性的 5xx,導致路径走不通。
這些資料不需要做到精确統計,但足以判断發現路径是否已经接上。如果新地址迟迟没有出現在日誌里,通常說明入口還不够稳定,而不是抓取端的問题。
改版後的 URL 發現,本质是让蜘蛛用尽量少的跳轉找到最终地址。入口、跳轉、sitemap 三者指向一致,恢复會顺一些;三者互相打架,回訪舊地址的時間就會被拉長。