网站收录

收录率该怎么算:分母口径不同,结论会差很远

收录率这个指标常被引用,但分子和分母的口径不同,结论可能完全相反。本文说明三种常见分母取法、三个分子数据源的偏差,以及按模板分层核对的做法,帮助你把收录数据落到具体动作上。

网站收录

收录率该怎么算:分母口径不同,结论会差很远

“站点收录得怎么样”几乎是每次复盘都会被问到的问题,但真正值得先问的是:这个数字是怎么算出来的。收录率本身不是坏指标,只是它的分子和分母都很容易被随意定义,口径一变,结论可能完全相反。

分子和分母,先写清楚再谈高低

收录率大致等于“已被索引的 URL 数”除以“我们希望被抓取和索引的 URL 总数”。两个数看着直白,实际都有多种取法。

  • 分母取 sitemap 里的 URL 数量:适合主动提交的站点,但 sitemap 往往落后于真实页面。
  • 分母取数据库里“对外可访问”的页面数:更接近真实规模,但需要先排除 noindex、已下架、参数拼接等页面。
  • 分母取日志中出现过的 URL 数量:反映搜索引擎实际看到过的范围,通常比前两者都大。

分母不同,同一个站点算出来的收录率可能相差几十个百分点。所以在看这个指标之前,最好把它背后的定义写在报表里,而不是只留一个百分比给人猜。

分子从哪里读:三个数据源各有偏差

索引报告

索引报告按模板和状态聚合,适合看趋势和分布,但数据存在延迟,而且“已编入索引”不代表有展示、有流量。

site: 查询

它只能给出粗略量级,结果会随查询词、地区、时间波动。用它的条数去算收录率,误差往往比预期大,更适合做前后对比,而不是绝对计数。

日志与 URL 检查

日志能告诉你搜索引擎来过哪些 URL、返回了什么状态码;URL 检查能确认单个 URL 的真实索引状态。两者结合适合做抽样核对,但不适合全站统计。

口径不同,会带来什么结论

假设一个站点有 5000 个对外可访问的页面,其中 3000 个进了 sitemap,最终被索引的有 2800 个。

  • 以 sitemap 为分母:收录率约 93%,看上去很好。
  • 以可访问页面为分母:约 56%,看上去需要处理。

两个数字都没算错,但指向的动作完全不同。前一个会让人以为没问题,后一个会推动你去查剩余页面为什么没进索引——答案常常在模板质量、内链分发或参数重复上,而不是什么“降权”。

更实用的做法:分层算,而不是全站一个数

  1. 按模板分组:详情页、列表页、标签页、筛选页、帮助页等分别统计。
  2. 每组固定分母口径,下次核对时保持一致,避免口径漂移。
  3. 每组抽十几个 URL,用 URL 检查或日志确认实际状态。
  4. 比较各组之间的差异,而不是只盯全站平均值。

平均值会把问题摊平。如果详情页收录率 60%、列表页收录率 98%,全站平均可能是 85%,你从这个数里看不出该修哪里。

几个常见误读

  • 把收录率高当成健康:薄内容页大量被索引,短期数字好看,长期是负担。
  • 把收录率低当成惩罚:更常见的原因是模板差异、抓取分配、内链不足。
  • 拿一次数据下结论:索引状态会随抓取和更新变化,固定周期看趋势更有意义。
  • 忽略分母里本就不该收录的页面:这些页面应当先排除,而不是等它拉低整体比例。
收录率是内部管理指标,不是对外成绩单。它的价值在于分层对比和趋势跟踪,而不是一个孤立的百分比。

与其争一个数字的高低,不如把口径写清楚、把分母拆开、按模板看差异。这样得到的结论才能落到具体动作上:是补内链、合并重复页,还是调整模板结构。