网站收录

收录率的分母算错了:sitemap 数量不等于可收录 URL 总量

做收录自查时,很多人拿 sitemap 提交量当分母算收录率,结果常常对不上。本文对比 sitemap、服务器日志、站内链接可达三种统计口径的差别,说明分子里各种索引状态该怎么算,并给出按页面类型分桶统计的做法,让收录判断更接近实际情况。

网站收录

收录率的分母算错了:sitemap 数量不等于可收录 URL 总量

做收录自查时,最常见的做法是拿 sitemap 里提交的 URL 数量当分母,用索引里的页面数当分子,算出一个收录率。这个数字看起来直观,实际用起来却经常对不上:有时超过 100%,有时低得离谱。问题往往不在搜索引擎,而在分母的取法本身。

三种常见的分母,含义完全不同

同样叫可收录 URL 总量,不同来源得到的集合差别很大:

  • sitemap 提交量:你主动列出的 URL,通常只覆盖核心页面,不含分页、筛选、搜索等自动生成的地址。
  • 日志中的 URL 集合:蜘蛛实际请求过的地址,会混入历史遗留、参数变体和早已下线的页面。
  • 站内链接可达的 URL 集合:从首页出发顺着链接能走到的全部地址,最接近搜索引擎有渠道发现的总量。

把这三个数放在一起看,往往能差出几倍。用哪个做分母,取决于你想回答什么问题:想评估提交内容的处理情况就用 sitemap,想评估整站被发现的情况就用站内可达集合。

为什么 sitemap 通常不适合当分母

  • sitemap 有数量和体积限制,大站往往只提交重点栏目,长尾页面不在其中。
  • 已经改版、合并或下线的旧 URL 可能还留在文件里,分子里根本没有它们。
  • 自动生成的列表页、标签页、参数页一般不会写进 sitemap,但它们确实存在于站内。
  • sitemap 的更新与抓取之间有滞后,分母会随时间漂移。

所以当你看到提交 500 条、索引 1200 条这种结果时,先别急着判断异常,多数情况下只是两个数字的统计范围不一致。

分子也不干净

索引状态报告里,已发现、已抓取、重复网页、备用网页、已排除是并列的状态,并不是都算收录。用哪种口径统计,结论会差很多。如果把已抓取但未编入索引也算作已收录,收录率会虚高;只算已编入索引,又会漏掉那些以备用页面形式存在的正常地址。

另一个常见来源是 site: 查询。它返回的是估算值,波动较大,只适合看数量级变化,不适合做精确的比率计算。

更实用的做法:按页面类型分桶

与其纠结一个总数,不如把 URL 拆开看。步骤大致如下:

  1. 从服务器日志或站内爬虫导出一份完整的 URL 列表。
  2. 按模板归类:详情页、栏目页、标签页、搜索页、分页、带参数的变体。
  3. 每一类分别统计被索引的比例,而不是混在一起算总分。
  4. 对比例明显偏低的类别单独排查:是否被 noindex 拦住、canonical 是否指向了别处、正文内容是否过少,或者入口链接太深。

这样得到的结果才有可操作性。比如详情页索引率九成、标签页只有两成,接下来要处理的是标签页该不该放开,而不是笼统地去提高收录率。

收录比例是体检指标,不是运营目标。真正需要盯的是关键页面有没有稳定进入索引,以及索引里的版本是否和线上一致。

什么时候才需要关注这个数字

绝对值的参考意义有限,趋势更有用。把同一口径的统计定期记录,看它在几周内的变化。如果某一类页面的索引比例出现明显下滑,再去查抓取量、状态码、内容改动和规范标签的变化,排查范围会小很多。

换句话说,先把分母和分子定义清楚,再谈收录情况好坏。口径不统一时,讨论收录率基本没有意义。