搜索抓取

抓取覆盖率与索引覆盖率对不上:差额里藏着哪些问题

抓取覆盖率和索引覆盖率是两个容易混为一谈的指标。抓得多不一定被收录,收录量变化也未必源于抓取。这篇文章拆解两者对不上的几种常见差额,给出从目录拆分到抽样核对的排查顺序,帮助你判断问题出在抓取链路还是页面本身。

搜索抓取

抓取覆盖率与索引覆盖率对不上:差额里藏着哪些问题

在站长后台,很多人只盯着一个数字:索引量。但真正能解释问题的,往往是两个数字放在一起看——蜘蛛抓了多少,和最终被编入索引的有多少。这两个数字长期对不上,说明站点某一段链路出了问题。差额本身不是故障,而是一条线索。

先把两个概念分清

抓取覆盖率,指的是蜘蛛在统计周期内实际访问并读取的 URL 数量。索引覆盖率,指的是这些 URL 中被搜索引擎判定为可以展示、并已进入索引的数量。前者衡量蜘蛛愿不愿意来、来不来得及读;后者衡量读完以后认不认这个页面。

抓取是过程,索引是结果。过程顺畅不等于结果理想,结果不理想也未必是抓取的问题。把两者混为一谈,就容易在错误的方向上做优化。

抓得多、索引少:差额通常出在哪

  • 页面内容高度重复或模板化,蜘蛛读完判定价值不足。
  • canonical、noindex 或 robots 规则把它们主动排除在外。
  • 软 404 与空壳页:返回 200,但正文几乎没有实质内容。
  • 参数页、排序页、筛选页生成大量近似 URL,被当作低质量变体。
  • 页面虽然能抓,但主要依赖客户端渲染,蜘蛛拿到的是一段空壳。

这一类差额,问题往往不在抓,而在页。继续加大抓取力度只会放大浪费。

抓得少、索引也不多:先看抓取链路

如果抓取覆盖率本身就偏低,索引量自然上不去。常见原因包括:内链层级太深,重要页面没有稳定入链;Sitemap 长期不更新,里面躺着大量 404 或重定向;服务器响应偏慢,蜘蛛每次来访都容易超时;或者抓取额度被低质量目录页大量消耗。

抓取额度是被花掉的,不是被分配的。低价值 URL 抓得越多,高价值 URL 排得越靠后。

索引比抓取还多,也别急着高兴

偶尔会出现索引数量大于同期抓取数量的情况,这通常是统计口径与时间窗口造成的:索引数据反映的是历史累积,抓取数据反映的是近期行为。还有一种可能是,页面通过其他抓取通道被发现。这类差异一般不需要特别处理,观察趋势即可。

用一份分层清单来排查

  1. 先看总量趋势:抓取和索引两条曲线是长期背离,还是短周期波动。
  2. 再分目录看:把站点按栏目拆分,找出差额最大的那一块。
  3. 抽样看具体 URL:从差额目录里随机抽几十条,逐一确认状态码、canonical、正文长度。
  4. 核对内部链接:这些 URL 是否有稳定的站内入口,还是只能靠 Sitemap 被发现。
  5. 检查服务器响应:平均响应时间、超时比例、5xx 比例是否在可接受范围。

把动作落到能改的地方

差额本身没法一次性抹平,但可以逐段收窄。对内容重复的目录做合并或加 canonical;对空壳页补充实质内容,或者干脆去掉入口;对深层页面补内链,缩短从首页出发的路径;对服务器,优先解决超时,而不是先想着去调抓取频次设置。

每次只改一层,改完等两到四周再对比数据。同时改三五处,最后谁也说不清是哪一步起了作用。抓取与索引的差额,本质上是一份诊断清单,不是一个需要冲高的指标。