收錄量上涨通常是好事,但如果涨上来的都是你並不希望被搜到的頁面,麻烦就来了。這類情况常被称作「索引膨胀」:站点里真正有價值的頁面只有几百個,索引里却躺着几千甚至几萬條 URL,其中大部分是篩選结果頁、分頁尾頁、空列表、用戶中心快照之類。
索引膨胀是怎么形成的
多數情况下不是蜘蛛乱抓,而是站点主動给出了太多可抓、可索引的入口。
- 參數组合爆炸:篩選、排序、分頁參數自由组合,同一個列表頁能裂變出成百上千個 URL。
- 空结果頁可訪問:篩選後没有任何结果,頁面照样返回 200 並渲染整套模板。
- 模板化聚合:标簽頁、作者頁、地区頁由同一套模板批量生成,正文差异极小。
- 功能頁暴露:购物车、登入後頁面、打印頁、站内搜尋结果頁没有被挡在抓取范围之外。
先分清是真膨胀,還是只是看着多
判断标准不是绝對數量,而是每個頁面有没有獨立價值。一個只有三條商品的分類頁可以保留,一個把價格区間切成二十段的篩選頁通常没必要。
- 用站内搜尋指令抽查某個目錄,看标题和摘要是否高度雷同。
- 在索引覆盖率报告里,重点看「已抓取,尚未编入索引」和「重复網頁,搜尋引擎選擇的規范網頁與用戶指定的不同」這两類的占比與示例 URL。
- 随机抽二十條代表性地址,逐條問自己:這個頁面能解决什么搜尋需求?答不上来的,就属于要收口的范围。
四種處理方式,不要只挑一種
保留
有獨立内容、有搜尋需求、能被自然連結指向的頁面,老老實實保留。不要因為一时焦虑就把整站批量處理。
合並與規范化
近似重复的頁面優先考虑合並:把多段篩選參數统一指向一個主地址,用 canonical 声明首選版本,站内連結也指向同一個 URL。這比直接屏蔽更稳妥,因為原有連結價值還能留住。
只屏蔽索引
頁面仍需被用戶訪問、也能被蜘蛛抓到,但不希望出現在搜尋结果里,用 noindex。客服帮助頁、临时活動頁常属于這一類。
彻底關閉
已经下线、不會再恢复的頁面,返回 404 或 410,让搜尋引擎自然剔除。長期挂着一個内容為空的 200 頁面,反而會一直占着抓取资源。
注意一個常见誤区:如果 robots.txt 已经把某個目錄挡住,蜘蛛就抓不到頁面上的 noindex 标簽,noindex 也就不會生效。想让它登出索引,就要允许抓取、同时返回 noindex;想省抓取预算,就得接受它可能長期留在索引里。两者很难同时满足。
收口之後看什么
調整生效需要時間,观察周期按周而不是按天比較合适。可以關注三個方向:一是目标目錄的抓取频次是否更集中到重要頁面上;二是索引覆盖率报告里有效頁面與排除頁面的比例變化;三是自己站内搜尋抽查时,雷同标题是否减少。如果發現重要頁面反而被誤挡,及时回滚對應規則即可。
索引膨胀本质上是站点结构和模板策略的問题,處理起来更像收拾房間,而不是一次性手術。想清楚每個目錄存在的理由,比堆叠各種防抓取技巧更管用。