网站收录

收录数据对不上 URL 总量:先算清可索引基数,再看覆盖率

收录数和 URL 总量差距大,多数是口径问题。本文拆开 URL 总量、可索引基数与已收录数三个数字,说明可索引基数要减掉哪些地址,并给出按模板分组看覆盖率、从索引规则到抓取节奏的排查顺序,避免把设计结果误判成收录故障。

网站收录

收录数据对不上 URL 总量:先算清可索引基数,再看覆盖率

做收录检查时,最常见的困惑是:站点一共几万条 URL,索引里只有几千条,是不是被降权了?大多数情况下,这个差距来自口径不同——你统计的是 URL 总量,而搜索引擎面对的是“可索引基数”。两个数字没对齐,后面的判断都会偏。

先把三个数字分开

想让结论站得住,至少要区分下面三个数字:

  • URL 总量:爬虫能抓到的地址总数,包含参数、筛选、分页、重复页。
  • 可索引基数:这些地址里,你真正希望被收录、并且允许被收录的那部分。
  • 已收录数:索引报告或 site 查询给出的结果,本身带估算成分。

真正该关心的是“已收录数 ÷ 可索引基数”,而不是“已收录数 ÷ URL 总量”。分母算错,覆盖率永远难看。

可索引基数怎么算

从 URL 总量里减掉下面几类,剩下的才接近可索引基数:

  • 明确设置了 noindex 的页面,比如站内搜索结果页、登录页、部分功能页。
  • robots.txt 里屏蔽抓取的目录。注意屏蔽抓取不等于禁止索引,被外链指向时仍可能出现在索引里。
  • canonical 统一指向其他地址的重复版本。
  • 排序、追踪、筛选类参数地址,除非它本身就是独立内容页。
  • 只承担翻页功能、没有独立价值的中间分页。
  • 返回 404 或 410 的死链,以及已经下线的旧地址。

建议按目录和模板各统计一次。很多站点全站覆盖率看着还行,拆开看却是几个模板在拖后腿。

覆盖率偏低时的排查顺序

  1. 先确认页面是否真的允许索引:meta noindex、X-Robots-Tag、robots 屏蔽、canonical 是否自指正确。
  2. 再看可抓取性:是否内链可达、是否被 JS 渲染阻隔、服务器对爬虫是否返回异常状态。
  3. 然后看内容同一性:同一模板批量生成的近似页面,容易被判定为价值不足而合并或排除。
  4. 最后看抓取节奏:新目录、新模板的抓取本来就滞后,用周为单位观察比按天看更靠谱。

两个容易踩的误区

  • 把不可索引页面当成“不收录问题”。筛选页被 noindex 是设计结果,不是缺陷。
  • 把 site 查询当准数。它是估算值,在大站上波动明显,只适合看趋势,不适合看绝对值。
判断收录健康度,先统一口径:分子是有效收录,分母是可索引基数,再看分组表现。

一份可落地的清单

  • 导出全站 URL 清单,按目录、模板、参数类型打标。
  • 给每个分组标注预期状态:应收录、应排除、观察中。
  • 只对“应收录”的组计算覆盖率,其余组检查规则是否按预期生效。
  • 对覆盖率明显偏低的组,先抽样看页面本身,再决定改内容、补内链还是收敛 URL。

把口径统一之后,你会发现相当一部分“收录异常”其实是统计方式造成的错觉;剩下的问题再去处理质量与抓取,方向也清楚得多。