很多站長把 site 结果的數字当成健康度指标,數字涨了就放心。但收錄量只是一個体量數字,它不区分頁面價值。当涨上去的是一批篩選组合、分頁、归档和空结果頁时,索引變大反而會带来副作用。
索引膨胀會带来哪些實际問题
- 抓取预算被摊薄:蜘蛛每次来訪能抓的頁面有限,低價值頁面多了,真正需要更新的頁面回訪就會變慢。
- 质量信号被稀释:一個目錄下堆积大量近似或空壳頁面,會让搜尋引擎對该目錄的整体判断變得模糊。
- 排查變难:日誌里蜘蛛路径被低價值 URL 占满,你想看的重点頁面反而不容易發現。
- 站内連結结构變乱:篩選頁互相連結,容易形成大面积的抓取路径。
收錄數字是结果,不是目标。它只能說明蜘蛛愿意抓,不能說明頁面值得留。
常见的几類膨胀来源
參數與篩選组合
电商、房产、招聘類站点最常见。颜色、尺碼、排序方式、價格区間任意组合,會生成大量内容高度重复的 URL。
分頁與日期归档
分頁第二頁之後的頁面、按日期归档的頁面,通常只在特定场景有價值,長期堆积就變成了体量。
标簽頁與聚合頁
标簽頁如果只有一個列表、没有獨立描述,和其他标簽頁之間差別很小,容易被当成近似頁面。
空结果頁與软 404
搜尋無结果、商品已下架的頁面,如果返回 200 且没有實质内容,也可能被索引。
怎么確認自己有没有膨胀
- 用 site: 加目錄前缀抽样,看每個目錄被收錄的主要是哪類頁面。
- 翻服務器日誌,按路径前缀統計蜘蛛抓取量,再和该目錄带来的自然流量做對比。
- 找出抓取量高、流量近乎為零的路径前缀,這類通常是重点嫌疑。
- 抽查這些頁面的标题和正文,確認是否有獨立内容。
處理顺序:先收口,再减入口
對確認没有價值的頁面,一般按這個思路處理:
- 能規范的用 canonical 指向主版本,比如把篩選頁指向對應分類主頁面。
- 不需要出現在索引里的,用 noindex 明确表態。
- 完全不必要被抓的,再考虑 robots.txt 屏蔽。注意两者關系:屏蔽之後蜘蛛讀不到頁面上的 noindex,索引里的舊條目需要靠頁面自然更新或刪除来處理。
- 减少内鏈入口,特別是頁脚、侧栏里批量輸出的連結。
- 把這些 URL 從站点地图中剔除。
別一刀切
有些篩選頁确實承接真實搜尋需求,比如“某品牌加某型号”這類组合。判断标准是它有没有獨立内容、有没有外部連結和自然流量,而不是它長得像參數頁。把有需求的留下、把纯组合的收口,比整体屏蔽更稳妥。
收口之後看什么
處理完不要指望立刻见效,索引更新需要時間。先看日誌里這些路径的抓取量是否下降,再看重点頁面的抓取频次有没有回升。把收錄總量拆成核心頁面和長尾頁面两部分来看,才不容易被一個總數誤導。