收錄量上升,很多人的第一反應是站点變好了。但收錄數字只說明“有更多地址進入了索引”,不說明這些地址都是你想留下来的。短期上涨尤其要拆開看:是内容确實變多了,還是索引里混進了一批本来不该出現的 URL。
先分清上涨的三種来源
把最近新增的地址做一次分類,比盯着總數有用。大方向上可以分成三類,處理方式完全不同。
- 正常新增:新發布的文章、新增的栏目、结构扩展带来的新頁面。這類地址有獨立内容,值得保留。
- 索引膨胀:篩選參數、排序參數、會话參數、日歷頁、站内搜尋结果頁等由程序生成的地址。這類地址内容重复度高,可替代性强。
- 重复地址:同一頁面因為 http/https、www 與無 www、结尾斜杠、大小寫等原因产生的多個地址。
三類的共同点是都會让收錄數字變大,区別在于前一類是资产,後两類多數是负担。
正常新增:看内容是否站得住
如果是正常新增,重点不是压數量,而是確認這些頁面能被稳定抓取和索引。可以抽查几篇新頁面,看它有没有獨立正文、有没有内鏈把它托到能被發現的位置、标题和描述是否和正文對得上。
這類頁面不建议用 noindex 一刀切。數量增長本身不是問题,問题往往出在把增長和膨胀混在一起看。
索引膨胀:多數来自程序生成的地址
參數地址是最容易被忽略的一類。列表頁翻頁、價格区間篩選、排序方式切換,往往一個篩選條件就生成一批新 URL。這些地址對用戶有用,但對索引未必有用,因為它們的正文高度相似,容易互相稀释。
核對时可以先抽样:在 site 查询结果或索引覆盖报告里,把带問号、带排序字段的地址挑出来,估算它們占新增收錄的比例。如果占比明顯偏高,就要考虑收敛。
重复地址:先做归一再谈收錄
同一頁面出現多個地址时,索引里可能同时存在多條记錄。常见来源包括协议切換、域名前缀不一致、结尾斜杠寫法不统一、URL 里大小寫混用。這類問题處理起来最直接:确定唯一的規范地址,其余地址通過 301 归一到它。
归一的目标不是把地址變少,而是让蜘蛛每次訪問同一篇内容时,都落到同一個地址上。
抽样核對的几個入口
- 用 site 查询看總量,同时抽看几頁结果,观察地址形態是否杂乱。
- 在索引覆盖报告里找“已發現”“已抓取未编入索引”等分類,看新增集中在哪一類。
- 翻抓取日誌,統計新出現的 URL 模式,判断是内容頁還是參數頁。
- 用内鏈和 sitemap 交叉检查,確認哪些地址是你主動放出去的。
處置顺序建议
不要一上来就大規模屏蔽。可以按這個顺序走:先做 URL 归一,解决重复地址;再對參數類頁面做收敛,比如用 canonical 指向主列表頁,或在 robots.txt 里挡掉没有检索價值的參數组合;最後才考虑對确實没有留存意义的頁面加 noindex。每一步做完观察一段時間,再决定下一步。
需要注意的是,收敛動作通常會带来收錄數字下降,這是正常現象,不代表站点變差。判断标准應该是:留下来的地址是否覆盖了主要内容,用戶從搜尋進来能否找到想要的東西。
小结
收錄量上涨值得高兴的前提,是新增的那部分地址真的在承载内容。先分類、再抽样、後處置,比看到一個數字就下判断稳妥得多。