索引膨胀说的是什么
索引膨胀指的是:站点里被搜尋引擎收錄的 URL 數量,遠遠超過真正有價值的内容頁數量。多出来的部分通常不是外鏈造成的,而是站点自己批量生成的——同一份内容因為參數、排序、篩選、會话标识的差异,被当成很多個頁面放進了索引。它一般不會直接带来惩罚,但會持續稀释抓取机會和质量判断。
常见的几個来源
- 篩選與排序參數:颜色、價格区間、排序方式组合出的 URL,頁面正文差异极小。
- 站内搜尋结果頁:以搜尋词參數结尾的 URL 可以被無限构造,且大多没有獨立價值。
- 會话與追踪參數:utm、sessionid、ref 這類參數不應该出現在被索引的 URL 里。
- 日歷頁、空列表頁、無结果頁:由模板自動生成,可訪問但内容极薄。
- 浅层分頁:要不要收,得看翻頁後是否還有可讀内容,不必一刀切。
為什么它拖慢的是收錄
抓取机會被分走
搜尋引擎每天愿意花在一個站点上的抓取资源是有限的。当大量參數頁、空頁占據抓取队列,新發布的内容頁和真正需要更新的頁面就要排在後面,被發現和被重新抓取的時間都會往後推。
同站頁面互相竞争
多個 URL 承载几乎相同的内容时,搜尋引擎需要自己判断哪一個是主版本。判断结果不稳定,就會出現同一批關鍵詞下入口来回切換、頁面表現起伏的情况。這既影响观察,也影响运营判断。
先判断,再動手
- 用 site: 抽样看看索引里都是哪几類 URL,注意這個數字是估算值,看類型分布比看總量更有意义。
- 查服務器日誌,統計被抓取次數最多的 URL 属于哪一類,很多問题在日誌里比在报告里更早暴露。
- 把索引报告里的“已發現但未抓取”和“已抓取但未索引”分開看,前者多說明抓取入口有問题,後者多說明内容判断有問题。
收口时的两個常见坑
robots.txt 和 noindex 不是一回事。robots.txt 是禁止抓取,搜尋引擎拿不到頁面内容,自然也讀不到頁面上的 noindex;對一個已经被收錄的 URL,只加 robots.txt 通常不會让它登出索引。更稳妥的顺序是:先允许抓取,再让頁面返回 noindex;對确實下线的頁面,直接返回 410 或 404 也是明确信号。canonical 可以用于合並,但前提是頁面之間确實是同一内容的不同展現,否則容易被忽略。
一個简單的判断标准:如果這個 URL 單獨被用戶打開时,内容不值得儲存或分享,它大概率也不值得長期占用索引位置。
一個可执行的顺序
- 先處理追踪參數和會话參數,這類基本是纯噪音,改動風險也最低。
- 再收敛篩選、排序和搜尋頁,按頁面類型统一處理,而不是逐條改。
- 把 sitemap 換成只包含規范 URL 的版本,別把它当成收錄清單来用。
- 内鏈只指向規范版本,减少蜘蛛顺着站内連結發現副本的路径。
- 上线後持續观察几周,同时看索引數量與抓取分布的變化。
预期管理
索引數量下降是正常的,很多时候還是好事:留下的頁面能获得更集中的抓取和评估。這類調整通常以周為單位见效,不是改完第二天就能看到结果。真正值得關注的不是索引總量這個數字,而是有價值的頁面是否更容易被抓取、被收錄,並且稳定地留在索引里。