做站点运营的人很容易养成一个习惯:打开搜索资源平台的覆盖率报表,先看“已编入索引”那一栏的数字,涨了就安心,跌了就紧张。但这个数字本身既不是收录率,也不能单独说明站点健康状况,它只是某个分母下的一次快照。
一、先确认分母是什么
收录覆盖率大致等于:被索引的 URL 数 ÷ 你希望被索引的 URL 数。问题几乎永远出在分母上。
- 分母用 sitemap 里的 URL 数量:最省事,但 sitemap 里常混着已下线、重复、本来就不该收录的地址。
- 分母用抓取日志里出现过的 URL:会混入参数页、排序页、分页和预览环境。
- 分母用数据库里“应该公开”的页面数:最接近真实情况,但需要自己持续维护。
分母不同,同一个站点算出来的“收录率”可以从四成变成九成。所以报表数字变化时,先问一句:是分子动了,还是分母动了。
二、覆盖率报表里的几类状态要分开读
- 已编入索引:真正进入索引的地址,但可能只是被索引,很少被展示。
- 已抓取,尚未编入索引:蜘蛛来过了,但判断暂时不值得收录,通常和内容质量、重复度有关。
- 已发现,尚未抓取:还在排队,常见于层级太深、内链太少、抓取预算吃紧的情况。
- 重复网页,未选为规范网页:多来自参数、排序、翻页或多语言镜像。
- 已排除:robots、noindex、404、重定向等主动或被动挡住的结果。
把这几类混在一起看总数,等于把“没被发现的”和“主动不想被发现的”算成同一件事,后续动作自然会走偏。
三、site: 查出来的数字为什么对不上
site: 查询是估算值,适合快速判断“大概有没有被收录”,不适合做精细统计。它受查询词、地域、查询时间影响,同一个 URL 今天查得到、明天查不到都很正常。要确认单个 URL 的状态,用 URL 检查工具比反复 site: 更靠谱。
四、让覆盖率变成能跟进的指标
- 固定分母:选一个可维护的清单,比如按页型分组的公开 URL 集合,每次统计都用它。
- 按页型拆开看:列表页、详情页、聚合页的收录节奏本来就不一样,混在一起波动会被抹平。
- 记录时间点:同一批 URL 隔两周再查一次,看的是趋势而不是单日数值。
- 关注“已抓取未索引”的占比:这个比例上升,通常比总收录数下降更值得先处理。
五、两个常见误判
误判一:收录数少了,一定是页面变差了。也可能只是这次统计的分母比上次多了一批参数页。
误判二:收录数多了,说明优化有效。也可能只是低质量页面被大量收进去,反而拉低了整站的平均表现。
六、小结
收录覆盖率是一个管理工具,不是成绩单。先把分母定义清楚,再按页型和状态分类看趋势,你才能判断问题出在发现环节、抓取环节还是质量环节。数字涨跌本身说明不了什么,能解释涨跌的原因才有意义。