讨论收录情况时,“收录率”几乎是最常被提起的数字,但它也是最容易被算错的数字之一。同一个站点,换一个分母,收录率可能从 30% 变成 80%。所以在拿这个数字做判断之前,先要明确:你到底把什么算进了分母。
分母的三种常见来源
实际操作中,收录率的分母通常来自三个地方,它们对应的结论完全不同。
- 站点地图里提交的 URL 数:最容易拿到,也最容易失真。如果站点地图长期没有维护,里面还留着已删除、已改版、带参数的旧地址,分母就会被抬高,收录率看起来永远偏低。
- 抓取日志里去重后的 URL 数:反映的是搜索引擎实际遇到过哪些地址,而不是站点希望被收录哪些。日志里往往包含大量重复、参数和无关目录,同样不适合直接当分母。
- 站内真实可索引的页面数:把返回 200、没有 noindex、主体内容不依赖脚本渲染、内链可达的页面筛出来,这是最接近“应该被收录”的口径。
如果只是想知道站点整体健康度,用第三种分母更有意义;如果只是想验证站点地图是否有效,才用第一种。两种口径不要混着用,更不要拿其中一种算出的百分比去解释另一种的问题。
分子也不止一个来源
分子常被默认成后台显示“已编入索引”的数量,但这个数字本身就有口径差异:它统计的是某个资源下所有被索引的 URL,其中可能包括你未必想要的那些。索引状态报告、URL 检查工具、站内搜索指令给出的结果经常对不上,因为统计范围和时间窗不同。
比较稳妥的做法是:选定一个来源,长期只用它做纵向对比。不要今天用 A、明天用 B,然后得出“收录掉了”的结论。
把收录率拆开看
全站收录率 70% 这个数字本身没什么用,因为它可能由一批收录率 95% 的文章页和一批收录率 10% 的筛选页平均而来。更有价值的做法是按目录、按模板、按页面类型分别统计:
- 文章详情页与产品详情页
- 列表页与分页地址
- 标签页、聚合页
- 带筛选或排序参数的地址
拆开之后,通常能立刻看出问题集中在哪一类模板,而不是笼统的“全站收录差”。
收录率偏低时的排查顺序
- 先确认分母里没有混进不该收录的地址:noindex 页面、重定向、404、纯参数页。
- 再看抓取日志:蜘蛛是否真的到达过这些 URL,还是停留在发现阶段。
- 看页面本身:内容是否过薄、是否与其他页面高度重复、主体内容是否必须渲染后才出现。
- 看入口:这些页面能否在站内几个点击内到达,有没有稳定的内链指向。
- 最后看时间:新页面从被发现到进入索引本身需要周期,刚上线几天的页面不适合放进统计。
哪些数字不必追
收录率高不等于流量高,收录率低也不一定说明站点有问题。有些页面类型本来就不该被收录,把它们算进分母再追求 100%,只会让团队去做没有意义的动作。
把分母定清楚,把统计口径固定下来,再按目录拆开看,收录率才是一个能用来做判断的指标。否则它只是一个每次计算都不同、却看起来很像结论的数字。