站点上线一段時間後,很多人會去看索引總量。偶尔會看到這样一個現象:明明只有几千個内容頁,索引里却顯示上萬條地址。多出来的部分,大多来自篩選頁、标簽頁、搜尋结果頁和各種參數组合。它們不是错誤頁面,抓取正常、返回 200,被收錄本身也符合規則,但會让索引体积虚高,稀释站点整体的质量判断。這篇讲這類頁面怎么识別、哪些该留、按什么顺序收敛。
索引膨胀的常见来源
- 列表頁的篩選與排序參數:颜色、價格区間、排序方式、每頁條數,两两组合就是成倍的地址。
- 标簽頁、话题頁:自動生成的标簽只挂一两篇内容,却和栏目頁高度重复。
- 站内搜尋结果頁:關鍵詞無穷,地址無穷,多數没有獨立检索價值。
- 日歷、作者、归档頁:按年月或按作者平铺,内容與列表頁几乎一致。
- 測試域名、舊域名、临时路径:改版或測試留下的可訪問地址,被外部連結带進了索引。
- 分頁過深:一個列表翻到几十頁之後,内容價值很低却仍被逐個抓取。
判断标准其實很简單:這個地址被搜到的时候,用戶會不會觉得它回答了問题。如果它只是同一批内容的另一種排列方式,多半不属于该進索引的那一類。
先確認,再動手
收敛之前先抽样看看。用 site: 指令加路径前缀,观察有多少條被收錄、落在哪些模式上。再對照索引覆盖报告和服務器日誌,看蜘蛛把抓取量花在了哪類地址上。很多站点的問题不是頁面被收錄,而是抓取配額被這些组合地址吃掉,真正需要及时更新的内容頁反而排到了後面。
同时要区分两件事:抓取和收錄不是一回事。一個地址被抓取過,不代表它會留在索引里;反過来,想让它登出索引,也不能只靠 robots.txt 屏蔽抓取——被拦住的頁面,meta noindex 也就讀不到了。
按這個顺序收敛
- 先看需求。有真實搜尋需求的篩選组合(比如品牌加型号、地区加品類)可以保留,甚至單獨優化;纯排列组合、没有獨立检索價值的,優先處理。
- 再改内鏈。减少指向篩選组合、日歷頁、标簽頁的入口,让蜘蛛自然少發現這些地址。内鏈是最温和也最有效的手段,改動成本低,也不影响已收錄頁面的正常訪問。
- 需要登出索引的,頁面保持可抓取,加 meta noindex,並確認渲染後的 HTML 里能讀到它。批量處理时按路径前缀分几批,方便回查。
- 參數類地址優先用 canonical 指向無參數的主地址,同一批内容只保留一個規范版本,避免同内容多地址並存。
- 确定長期不存在的地址,用 410 或 301;不要用 302 長期挂着,也不要让 404 頁面返回 200。
- 處理完更新站点地图,只提交真正希望被索引的地址,別把篩選组合塞進去。
不要一刀切
把所有篩選頁和标簽頁统统屏蔽,是常见的過头做法。有些标簽頁本身就是不错的聚合入口,流量和轉化都在;有些篩選组合词有稳定搜尋量。判断依據應该是資料和内容质量,而不是頁面類型。可以分三步走:先保留,观察搜尋表現;表現差的逐步收敛;完全没有曝光和点击的,再统一清理。
索引數量本身不是指标。真正值得關注的是:進入索引的地址里,有多少能拿到曝光和点击。
收敛後要复查
- 索引报告里目标路径的數量是否下降,下降通常是渐進的,需要几周。
- 在驗證工具里抽查几個样板地址,確認 noindex 或 canonical 被正确识別。
- 看抓取統計,確認蜘蛛把更多配額分给了内容頁。
- 確認重要頁面的收錄没有被誤伤,尤其是保留的标簽聚合頁和栏目頁。
最後提醒一点:收敛的目标是让索引更贴近站点真實的内容结构,不是把數字压低。如果數字降下来、重要頁面的曝光也跟着掉了,說明處理范围划错了,需要回退。