很多运营同学会把“收录率”当成一个健康分:算出来 90% 就松口气,只有 40% 就急着改页面。但收录率本身并不是客观事实,它取决于你把哪些 URL 放进分母、用哪种方式统计分子。定义不同,同一个站点可以算出 40%,也可以算出 90%。所以第一步不是看数字高低,而是先把这两个数定义清楚。
分母:哪些 URL 有资格被算进来
分母应该是“你真正希望被收录的 URL 集合”,而不是数据库里的地址总数。
- 带筛选、排序、追踪参数的 URL,如果已经用 canonical 或 robots 收口,就不该进分母。
- 登录页、购物车、搜索结果页、测试页、后台路径,本来就不打算进索引,算进去只会拉低数值。
- 已 301 跳转的旧地址、返回 404 或 410 的地址属于历史遗留,不该和正常页面混在一起。
- 同一内容的分页、打印版、站内镜像,如果策略是只保留主版本,其余也不计入。
实际做法分两层:先算出全站候选 URL 数,再减去明确排除的类别,得到“目标收录集合”,这个数才是分母。分母变小,收录率会上升,但这不是自欺欺人,而是把指标对准了真实目标。
分子:已收录数量至少用两种方式交叉看
没有一种方法能给出绝对准确的已收录数量,各自都有偏差:
- site 查询:数量级参考,不同时间、不同地区结果差异明显,还会漏掉部分页面,不宜当作精确值。
- 站长后台的覆盖或页面报告:按“已编入索引”分组统计,相对更接近真实,但更新有延迟,也会合并部分近似 URL。
- 日志加抽样:从日志里挑一批典型 URL,逐个确认索引状态,再按比例推算。样本要覆盖不同模板和层级,否则误差很大。
把三种结果放在一起,如果数量级接近,说明判断基本可靠;如果相差几倍,先别下结论,去查是哪一类 URL 被不同工具重复或漏算。
收录率多少算正常
没有通用标准。影响因素包括站点体量、模板化程度、内容更新频率和外链情况。更值得关注的是两个信号:同一批新页面在数周内的收录进度是否接近;收录率随时间是在稳定、上升还是持续下滑。跟自己的历史比,比跟别人的绝对值比更有意义。
收录率偏低时的排查顺序
- 先确认分母里有没有混入不该算的 URL。这一步经常就能解释掉大部分差距。
- 检查被排除的那批 URL 是否真的按策略失效:该返回 410 的没返回,该 noindex 的漏了标签。
- 看未被收录的页面集中在哪个模板或目录。如果是某个栏目整体不收,问题多半在模板或内容结构,而不是单页。
- 看这些页面有没有站内入口。只有 sitemap 没有内链的页面,被发现的速度会明显慢。
- 核对内容是否与站内其他页面高度重合。近似内容过多时,往往只会留下其中一版,其余长期不收录。
- 最后再看抓取层面的问题:响应时间、错误率、是否被 robots 拦住。
别只看总数,看结构
收录率是聚合数,容易掩盖局部问题。同样是 70%,可能是所有栏目都均匀漏掉 30%,也可能是核心栏目正常、长尾栏目大面积不收。后者通常不用太慌,前者值得查。建议按目录、按模板、按上线时间分批统计,找出差异最大的那一组。
回到开头:收录率的价值在于帮你发现异常、定位方向,而不是给你一个可以攀比的分数。把分母定准,把分子交叉验证,再按结构拆开看,这个指标才真正能用得上。