先分清“多”的两種含义
核對索引量时,容易遇到两種不同的“多”。一種是索引里的 URL 數明顯大于後台已發布的文章數,另一種是搜尋结果條數看着比實际内容少。前者通常是形態差异造成的地址膨胀,後者多半是篩選、分頁或展示层的問题。判断之前先定一個可信口径:後台已發布、可正常訪問、且我們認可的規范地址有多少條,再拿索引里的 URL 去抽样對比,而不是只盯着總數曲线的涨跌。
多出来的地址一般来自這几處
- 大小寫、结尾斜杠、預設首頁等形態差异,各自被当成獨立地址。
- 带參數的地址:排序、分頁、追踪參數、會话參數。
- 附属輸出:打印版、纯文本版、简化版頁面。
- 附件與静態资源:图片、PDF、上传目錄下的文件。
- 聚合頁:标簽頁、作者頁、日歷頁、专题合集頁。
- 歷史遗留路径:舊目錄、舊站结构、測試路径仍然能打開。
- 站内搜尋结果頁被外部連結带出去,形成可被抓取的入口。
這些地址未必都是坏事。有些确實有獨立搜尋需求,有些則纯粹在消耗抓取资源。区別對待,比一刀切更稳。
按顺序核對,別一上来就删
- 抽样归類。從索引结果里取一批 URL,按目錄和參數特征分组,看多出来的集中在哪几類,先找到主要来源。
- 確認可訪問性。逐個看返回碼,是 200 還是有跳轉、有错誤。返回 200 且带正文的,處理方式和空頁完全不同。
- 查入口来源。這些地址是從内鏈、sitemap 還是外鏈被發現。如果站内到處鏈着它,改規范指向也没用,得先收口入口。
- 對齐規范信号。canonical、robots、sitemap 三處指向是否一致。三處打架时,多余的地址更容易被單獨留下。
- 排優先級。有搜尋需求、有外部連結的優先處理;没人訪問、没入口的可以放到後面。
抓取與收錄要分開看
地址被大量抓取,不等于它們會被大量收錄。反過来说,索引里留着一條记錄,也不代表它還在被频繁抓取。核對时把這两件事分開:抓取看的是日誌里的請求,收錄看的是索引里的记錄。如果日誌里參數頁請求占比很高,先收口參數入口;如果日誌干净但索引里仍有残留,重点就放在規范指向和移除處理上。
處理顺序:先合並,再收口,最後移除
對確認属于同一内容的多個形態地址,第一步是让它們指向同一個規范地址,並保證站内連結、sitemap 都只輸出這一個版本。第二步是把产生多余地址的入口關掉:參數入口、站内搜尋頁的外部传播、附件目錄的公開訪問。第三步才是對确實不需要保留的地址做移除申請。
顺序颠倒會带来反复。常见的情况是只提交了移除,但站内還在大量連結舊地址,過一段時間又被重新發現,問题回到原点。
不要為了“干净”一次性對成千上萬條 URL 做跳轉或移除。改動量太大时,观察窗口里的波動會盖住真實信号,也容易誤伤正常頁面。分批做,每批留出两到四周观察。
观察什么才算有效
- 抽样批次里的多余地址,返回碼和規范指向是否已经统一。
- 日誌中參數頁、附件頁的請求占比是否下降。
- 重点正文頁的抓取频次是否回升,而不是總抓取量下降就算成功。
- 索引總量缓慢回落属于正常,短時間内大幅波動要回头看是否有誤伤。
整体思路是:先把多余的地址归到少數几類,再一類一類處理。每一類都按“统一規范指向、收口入口、必要时移除”的顺序走,比盯着總數追涨杀跌有效得多。索引數字本身只是结果,真正要管的是站内到底放出了多少個可被抓取的入口。