收录量上升,很多人的第一反应是站点变好了。但收录数字只说明“有更多地址进入了索引”,不说明这些地址都是你想留下来的。短期上涨尤其要拆开看:是内容确实变多了,还是索引里混进了一批本来不该出现的 URL。
先分清上涨的三种来源
把最近新增的地址做一次分类,比盯着总数有用。大方向上可以分成三类,处理方式完全不同。
- 正常新增:新发布的文章、新增的栏目、结构扩展带来的新页面。这类地址有独立内容,值得保留。
- 索引膨胀:筛选参数、排序参数、会话参数、日历页、站内搜索结果页等由程序生成的地址。这类地址内容重复度高,可替代性强。
- 重复地址:同一页面因为 http/https、www 与无 www、结尾斜杠、大小写等原因产生的多个地址。
三类的共同点是都会让收录数字变大,区别在于前一类是资产,后两类多数是负担。
正常新增:看内容是否站得住
如果是正常新增,重点不是压数量,而是确认这些页面能被稳定抓取和索引。可以抽查几篇新页面,看它有没有独立正文、有没有内链把它托到能被发现的位置、标题和描述是否和正文对得上。
这类页面不建议用 noindex 一刀切。数量增长本身不是问题,问题往往出在把增长和膨胀混在一起看。
索引膨胀:多数来自程序生成的地址
参数地址是最容易被忽略的一类。列表页翻页、价格区间筛选、排序方式切换,往往一个筛选条件就生成一批新 URL。这些地址对用户有用,但对索引未必有用,因为它们的正文高度相似,容易互相稀释。
核对时可以先抽样:在 site 查询结果或索引覆盖报告里,把带问号、带排序字段的地址挑出来,估算它们占新增收录的比例。如果占比明显偏高,就要考虑收敛。
重复地址:先做归一再谈收录
同一页面出现多个地址时,索引里可能同时存在多条记录。常见来源包括协议切换、域名前缀不一致、结尾斜杠写法不统一、URL 里大小写混用。这类问题处理起来最直接:确定唯一的规范地址,其余地址通过 301 归一到它。
归一的目标不是把地址变少,而是让蜘蛛每次访问同一篇内容时,都落到同一个地址上。
抽样核对的几个入口
- 用 site 查询看总量,同时抽看几页结果,观察地址形态是否杂乱。
- 在索引覆盖报告里找“已发现”“已抓取未编入索引”等分类,看新增集中在哪一类。
- 翻抓取日志,统计新出现的 URL 模式,判断是内容页还是参数页。
- 用内链和 sitemap 交叉检查,确认哪些地址是你主动放出去的。
处置顺序建议
不要一上来就大规模屏蔽。可以按这个顺序走:先做 URL 归一,解决重复地址;再对参数类页面做收敛,比如用 canonical 指向主列表页,或在 robots.txt 里挡掉没有检索价值的参数组合;最后才考虑对确实没有留存意义的页面加 noindex。每一步做完观察一段时间,再决定下一步。
需要注意的是,收敛动作通常会带来收录数字下降,这是正常现象,不代表站点变差。判断标准应该是:留下来的地址是否覆盖了主要内容,用户从搜索进来能否找到想要的东西。
小结
收录量上涨值得高兴的前提,是新增的那部分地址真的在承载内容。先分类、再抽样、后处置,比看到一个数字就下判断稳妥得多。