查看站点收录数据时,如果页面数量在一两周内明显上涨,很多人的第一反应是「收录变好了」。但数量上涨和内容变好是两件事。多数情况下,多出来的那部分并不是新写的文章,而是站内本来就存在、只是之前没被算进来的 URL 变体。
先确认数量变化是不是统计口径的问题
在动手清理之前,先花十分钟排除误判。以下几种情况会让数字看起来在涨,但和内容质量无关:
- 不同查询工具返回的是估算值,本身有波动,前后差几百条不一定是真实变化。
- 站点做过 URL 结构调整、上线新模板、放开某类归档页,数量会一次性跳变。
- 移动版、打印页等历史镜像页面被重新抓取,也会让总数变大。
排除之后再看曲线形状。阶梯式上涨通常对应一次明确的改动,斜线式缓慢上涨往往意味着有模板在持续生产新 URL,这才需要认真处理。
多出来的页面通常集中在这几类
URL 变体
大小写、结尾是否带斜杠、是否带 index.html、http 与 https、www 与非 www,这些形式在服务器跳转和 canonical 没有统一之前,可能各自被当成独立 URL 进入索引。这类「多出来」的页面内容完全重复,是最没有保留价值的一批。
程序自动生成的页面
站内搜索结果页、筛选与排序的参数组合、标签交叉页、日历与日期归档、层级很深的列表分页,都属于模板批量产出。它们的数量往往和内容量不成比例,一次改版就可能多出成百上千个。
被引用和分享产生的页面
评论分页、用户个人主页、分享短链等,也会随着互动量增长而增加。这类页面数量不大,但常常和正文页共用同一套模板和标题。
判断标准:能不能独立满足一次搜索需求
决定留还是收,看的不是数量,而是这个 URL 有没有独立存在的理由。可以用下面几条对照:
- 有独立正文、对应一个真实搜索词的,留下。
- 只是把别处内容重新组合、没有额外信息的,考虑收敛。
- 参数组合穷举产生、页面内容为空的,优先收敛。
- 同一内容存在多个 URL 形式的,只保留一个规范形式。
需要区分的是抓取和收录:一个 URL 被蜘蛛抓到,不代表它会进索引;反过来,已经在索引里的页面,也不一定会持续被抓。清理时要针对「要不要进索引」做决定,而不是单纯减少被抓次数。
处理顺序建议
- 先统一 URL 规范。确定唯一的访问形式,其他形式做 301 指向它,规范页自身用自指的 canonical,不要互相指来指去。
- 再区分「该抓但不该收录」和「根本不该抓」。前者用 noindex,后者才用 robots.txt 屏蔽。
- 收敛程序生成页。把筛选参数限制在有效值范围内,站内搜索结果页加 noindex,避免组合无限扩张。
- 清理站内入口。无价值 URL 不再出现在导航、相关推荐和 sitemap 里,否则它们会不断被重新发现。
- 留出观察时间。索引更新有自己的节奏,处理完不会立刻见效,用两三周的数据对比更可靠。
注意:robots.txt 屏蔽抓取和 noindex 是两种不同手段。如果先用 robots.txt 挡掉了抓取,蜘蛛读不到页面上的 noindex,页面可能长期留在索引里退不出去。想让页面退出索引,通常是先让它能被抓,再给出 noindex。
一个可以定期做的自查
与其只盯着收录总数,不如每月导出一份已收录 URL 列表,按路径前缀分组统计占比。某个前缀的占比持续上涨,就说明那类模板在不停生产页面,先查它,比逐个页面看效率高得多。数量变化本身不是结论,它只是一个提示你去看看发生了什么。