網站收錄

索引里的頁面越收越多,流量却没動:先排查這几類膨胀来源

收錄量上涨常被当成好消息,但如果涨的是篩選頁、分頁、归档頁這類低價值 URL,索引体量變大反而會稀释抓取和评估资源。這篇文章讲怎么识別索引膨胀,從 site 抽样和服務器日誌入手,找到贡献收錄不贡献流量的路径,再按收口、减少入口、剔除站点地图的顺序處理。

網站收錄

索引里的頁面越收越多,流量却没動:先排查這几類膨胀来源

很多站長把 site 结果的數字当成健康度指标,數字涨了就放心。但收錄量只是一個体量數字,它不区分頁面價值。当涨上去的是一批篩選组合、分頁、归档和空结果頁时,索引變大反而會带来副作用。

索引膨胀會带来哪些實际問题

  • 抓取预算被摊薄:蜘蛛每次来訪能抓的頁面有限,低價值頁面多了,真正需要更新的頁面回訪就會變慢。
  • 质量信号被稀释:一個目錄下堆积大量近似或空壳頁面,會让搜尋引擎對该目錄的整体判断變得模糊。
  • 排查變难:日誌里蜘蛛路径被低價值 URL 占满,你想看的重点頁面反而不容易發現。
  • 站内連結结构變乱:篩選頁互相連結,容易形成大面积的抓取路径。
收錄數字是结果,不是目标。它只能說明蜘蛛愿意抓,不能說明頁面值得留。

常见的几類膨胀来源

參數與篩選组合

电商、房产、招聘類站点最常见。颜色、尺碼、排序方式、價格区間任意组合,會生成大量内容高度重复的 URL。

分頁與日期归档

分頁第二頁之後的頁面、按日期归档的頁面,通常只在特定场景有價值,長期堆积就變成了体量。

标簽頁與聚合頁

标簽頁如果只有一個列表、没有獨立描述,和其他标簽頁之間差別很小,容易被当成近似頁面。

空结果頁與软 404

搜尋無结果、商品已下架的頁面,如果返回 200 且没有實质内容,也可能被索引。

怎么確認自己有没有膨胀

  1. 用 site: 加目錄前缀抽样,看每個目錄被收錄的主要是哪類頁面。
  2. 翻服務器日誌,按路径前缀統計蜘蛛抓取量,再和该目錄带来的自然流量做對比。
  3. 找出抓取量高、流量近乎為零的路径前缀,這類通常是重点嫌疑。
  4. 抽查這些頁面的标题和正文,確認是否有獨立内容。

處理顺序:先收口,再减入口

對確認没有價值的頁面,一般按這個思路處理:

  • 能規范的用 canonical 指向主版本,比如把篩選頁指向對應分類主頁面。
  • 不需要出現在索引里的,用 noindex 明确表態。
  • 完全不必要被抓的,再考虑 robots.txt 屏蔽。注意两者關系:屏蔽之後蜘蛛讀不到頁面上的 noindex,索引里的舊條目需要靠頁面自然更新或刪除来處理。
  • 减少内鏈入口,特別是頁脚、侧栏里批量輸出的連結。
  • 把這些 URL 從站点地图中剔除。

別一刀切

有些篩選頁确實承接真實搜尋需求,比如“某品牌加某型号”這類组合。判断标准是它有没有獨立内容、有没有外部連結和自然流量,而不是它長得像參數頁。把有需求的留下、把纯组合的收口,比整体屏蔽更稳妥。

收口之後看什么

處理完不要指望立刻见效,索引更新需要時間。先看日誌里這些路径的抓取量是否下降,再看重点頁面的抓取频次有没有回升。把收錄總量拆成核心頁面和長尾頁面两部分来看,才不容易被一個總數誤導。