site: 的數字變大,很多人第一反應是收錄變好了。但如果索引里的 URL 數量遠多于站点真正想让人搜到的頁面,這更可能是索引膨胀:大量低價值、重复或临时的地址被搜尋引擎儲存了下来。它带来的直接结果是抓取額度被分散,重要頁面更新更慢,索引里還掺杂着過期或残缺的版本。
判断是否膨胀,不看绝對數字,而看比例。把索引中的 URL 按模式归類,看有多少落在你認可的“有效頁面”范围内。如果有效頁面只占很小一部分,就值得處理。
膨胀通常從哪来
自動生成、數量近乎無限的地址
- 篩選與排序參數:颜色、價格区間、排序方式组合出的地址。
- 站内搜尋结果頁:一次搜尋就是一個地址,數量几乎無上限。
- 日歷與日期归档頁:按天生成的空頁面。
- 标簽、作者、分類的深层组合頁。
内容极薄的頁面
只有标题和一句摘要的詳情頁、没有正文的活動頁、模板未填满的落地頁,本身價值有限,却因為站内到處有連結而被反复抓取。
會话與跟踪參數
带 session id、来源跟踪參數的地址,會為同一個頁面生成大量副本。
先归類,再動手
收敛之前要先有清單,否則容易誤伤。
- 從服務器日誌或索引抽样中收集一批 URL。
- 按可识別的模式分组:有無參數、路径前缀、是否搜尋頁。
- 给每组标注:是否有效頁面、是否有獨立搜尋需求、是否有真實訪問。
- 對没有價值的组,逐组确定處理方式。
處理的顺序很關键
最常见的错誤是一上来就用 robots.txt 挡住一批目錄,结果這些頁面仍留在索引里,因為搜尋引擎看不到頁面上的 noindex。
- 已经收錄、又不想要的頁面:優先用 noindex,让抓取繼續進行,等它讀到标簽後再登出索引。
- 從未收錄、也不想被抓的低價值路径:用 robots.txt 阻止抓取,避免繼續占用抓取額度。
- 只是重复但頁面本身有價值:用 canonical 指向主版本,並保證主版本自身可訪問、可被抓取。
- 减少入口:撤掉内鏈、導航和 sitemap 里的相關地址,让它們不再被持續發現。
處理信号需要時間。改完就反复检查、再叠加一层限制,往往會把問题弄复杂。
收敛之後看什么
不要只盯收錄總量。更有意义的观察對象是:有效頁面的抓取频次是否上升、新頁面被發現的速度是否變快、索引中是否還残留明顯無價值的地址。索引更新有滞後,通常按周观察,而不是按天。
如果一段時間後低價值地址减少,而核心頁面的抓取與更新表現變好,說明方向對了。反過来,如果有效頁面也開始掉出索引,要检查是否限制范围過宽,比如整站目錄被挡住,或者 canonical 指向了不该指向的地址。