做收录自查时,最常见的做法是拿 sitemap 里提交的 URL 数量当分母,用索引里的页面数当分子,算出一个收录率。这个数字看起来直观,实际用起来却经常对不上:有时超过 100%,有时低得离谱。问题往往不在搜索引擎,而在分母的取法本身。
三种常见的分母,含义完全不同
同样叫可收录 URL 总量,不同来源得到的集合差别很大:
- sitemap 提交量:你主动列出的 URL,通常只覆盖核心页面,不含分页、筛选、搜索等自动生成的地址。
- 日志中的 URL 集合:蜘蛛实际请求过的地址,会混入历史遗留、参数变体和早已下线的页面。
- 站内链接可达的 URL 集合:从首页出发顺着链接能走到的全部地址,最接近搜索引擎有渠道发现的总量。
把这三个数放在一起看,往往能差出几倍。用哪个做分母,取决于你想回答什么问题:想评估提交内容的处理情况就用 sitemap,想评估整站被发现的情况就用站内可达集合。
为什么 sitemap 通常不适合当分母
- sitemap 有数量和体积限制,大站往往只提交重点栏目,长尾页面不在其中。
- 已经改版、合并或下线的旧 URL 可能还留在文件里,分子里根本没有它们。
- 自动生成的列表页、标签页、参数页一般不会写进 sitemap,但它们确实存在于站内。
- sitemap 的更新与抓取之间有滞后,分母会随时间漂移。
所以当你看到提交 500 条、索引 1200 条这种结果时,先别急着判断异常,多数情况下只是两个数字的统计范围不一致。
分子也不干净
索引状态报告里,已发现、已抓取、重复网页、备用网页、已排除是并列的状态,并不是都算收录。用哪种口径统计,结论会差很多。如果把已抓取但未编入索引也算作已收录,收录率会虚高;只算已编入索引,又会漏掉那些以备用页面形式存在的正常地址。
另一个常见来源是 site: 查询。它返回的是估算值,波动较大,只适合看数量级变化,不适合做精确的比率计算。
更实用的做法:按页面类型分桶
与其纠结一个总数,不如把 URL 拆开看。步骤大致如下:
- 从服务器日志或站内爬虫导出一份完整的 URL 列表。
- 按模板归类:详情页、栏目页、标签页、搜索页、分页、带参数的变体。
- 每一类分别统计被索引的比例,而不是混在一起算总分。
- 对比例明显偏低的类别单独排查:是否被 noindex 拦住、canonical 是否指向了别处、正文内容是否过少,或者入口链接太深。
这样得到的结果才有可操作性。比如详情页索引率九成、标签页只有两成,接下来要处理的是标签页该不该放开,而不是笼统地去提高收录率。
收录比例是体检指标,不是运营目标。真正需要盯的是关键页面有没有稳定进入索引,以及索引里的版本是否和线上一致。
什么时候才需要关注这个数字
绝对值的参考意义有限,趋势更有用。把同一口径的统计定期记录,看它在几周内的变化。如果某一类页面的索引比例出现明显下滑,再去查抓取量、状态码、内容改动和规范标签的变化,排查范围会小很多。
换句话说,先把分母和分子定义清楚,再谈收录情况好坏。口径不统一时,讨论收录率基本没有意义。