做收录检查时,最常见的困惑是:站点一共几万条 URL,索引里只有几千条,是不是被降权了?大多数情况下,这个差距来自口径不同——你统计的是 URL 总量,而搜索引擎面对的是“可索引基数”。两个数字没对齐,后面的判断都会偏。
先把三个数字分开
想让结论站得住,至少要区分下面三个数字:
- URL 总量:爬虫能抓到的地址总数,包含参数、筛选、分页、重复页。
- 可索引基数:这些地址里,你真正希望被收录、并且允许被收录的那部分。
- 已收录数:索引报告或 site 查询给出的结果,本身带估算成分。
真正该关心的是“已收录数 ÷ 可索引基数”,而不是“已收录数 ÷ URL 总量”。分母算错,覆盖率永远难看。
可索引基数怎么算
从 URL 总量里减掉下面几类,剩下的才接近可索引基数:
- 明确设置了 noindex 的页面,比如站内搜索结果页、登录页、部分功能页。
- robots.txt 里屏蔽抓取的目录。注意屏蔽抓取不等于禁止索引,被外链指向时仍可能出现在索引里。
- canonical 统一指向其他地址的重复版本。
- 排序、追踪、筛选类参数地址,除非它本身就是独立内容页。
- 只承担翻页功能、没有独立价值的中间分页。
- 返回 404 或 410 的死链,以及已经下线的旧地址。
建议按目录和模板各统计一次。很多站点全站覆盖率看着还行,拆开看却是几个模板在拖后腿。
覆盖率偏低时的排查顺序
- 先确认页面是否真的允许索引:meta noindex、X-Robots-Tag、robots 屏蔽、canonical 是否自指正确。
- 再看可抓取性:是否内链可达、是否被 JS 渲染阻隔、服务器对爬虫是否返回异常状态。
- 然后看内容同一性:同一模板批量生成的近似页面,容易被判定为价值不足而合并或排除。
- 最后看抓取节奏:新目录、新模板的抓取本来就滞后,用周为单位观察比按天看更靠谱。
两个容易踩的误区
- 把不可索引页面当成“不收录问题”。筛选页被 noindex 是设计结果,不是缺陷。
- 把 site 查询当准数。它是估算值,在大站上波动明显,只适合看趋势,不适合看绝对值。
判断收录健康度,先统一口径:分子是有效收录,分母是可索引基数,再看分组表现。
一份可落地的清单
- 导出全站 URL 清单,按目录、模板、参数类型打标。
- 给每个分组标注预期状态:应收录、应排除、观察中。
- 只对“应收录”的组计算覆盖率,其余组检查规则是否按预期生效。
- 对覆盖率明显偏低的组,先抽样看页面本身,再决定改内容、补内链还是收敛 URL。
把口径统一之后,你会发现相当一部分“收录异常”其实是统计方式造成的错觉;剩下的问题再去处理质量与抓取,方向也清楚得多。