网站收录

算收录率之前,先把分母定清楚

收录率常被当作站点健康度指标,但分母不同,结论可能完全相反。本文说明站点地图、抓取日志、站内可索引页面三种分母的适用场景,以及分子口径差异、按目录拆分统计的方法,和收录率偏低时该按什么顺序排查。

网站收录

算收录率之前,先把分母定清楚

讨论收录情况时,“收录率”几乎是最常被提起的数字,但它也是最容易被算错的数字之一。同一个站点,换一个分母,收录率可能从 30% 变成 80%。所以在拿这个数字做判断之前,先要明确:你到底把什么算进了分母。

分母的三种常见来源

实际操作中,收录率的分母通常来自三个地方,它们对应的结论完全不同。

  • 站点地图里提交的 URL 数:最容易拿到,也最容易失真。如果站点地图长期没有维护,里面还留着已删除、已改版、带参数的旧地址,分母就会被抬高,收录率看起来永远偏低。
  • 抓取日志里去重后的 URL 数:反映的是搜索引擎实际遇到过哪些地址,而不是站点希望被收录哪些。日志里往往包含大量重复、参数和无关目录,同样不适合直接当分母。
  • 站内真实可索引的页面数:把返回 200、没有 noindex、主体内容不依赖脚本渲染、内链可达的页面筛出来,这是最接近“应该被收录”的口径。

如果只是想知道站点整体健康度,用第三种分母更有意义;如果只是想验证站点地图是否有效,才用第一种。两种口径不要混着用,更不要拿其中一种算出的百分比去解释另一种的问题。

分子也不止一个来源

分子常被默认成后台显示“已编入索引”的数量,但这个数字本身就有口径差异:它统计的是某个资源下所有被索引的 URL,其中可能包括你未必想要的那些。索引状态报告、URL 检查工具、站内搜索指令给出的结果经常对不上,因为统计范围和时间窗不同。

比较稳妥的做法是:选定一个来源,长期只用它做纵向对比。不要今天用 A、明天用 B,然后得出“收录掉了”的结论。

把收录率拆开看

全站收录率 70% 这个数字本身没什么用,因为它可能由一批收录率 95% 的文章页和一批收录率 10% 的筛选页平均而来。更有价值的做法是按目录、按模板、按页面类型分别统计:

  • 文章详情页与产品详情页
  • 列表页与分页地址
  • 标签页、聚合页
  • 带筛选或排序参数的地址

拆开之后,通常能立刻看出问题集中在哪一类模板,而不是笼统的“全站收录差”。

收录率偏低时的排查顺序

  1. 先确认分母里没有混进不该收录的地址:noindex 页面、重定向、404、纯参数页。
  2. 再看抓取日志:蜘蛛是否真的到达过这些 URL,还是停留在发现阶段。
  3. 看页面本身:内容是否过薄、是否与其他页面高度重复、主体内容是否必须渲染后才出现。
  4. 看入口:这些页面能否在站内几个点击内到达,有没有稳定的内链指向。
  5. 最后看时间:新页面从被发现到进入索引本身需要周期,刚上线几天的页面不适合放进统计。

哪些数字不必追

收录率高不等于流量高,收录率低也不一定说明站点有问题。有些页面类型本来就不该被收录,把它们算进分母再追求 100%,只会让团队去做没有意义的动作。

把分母定清楚,把统计口径固定下来,再按目录拆开看,收录率才是一个能用来做判断的指标。否则它只是一个每次计算都不同、却看起来很像结论的数字。