在站长后台,很多人只盯着一个数字:索引量。但真正能解释问题的,往往是两个数字放在一起看——蜘蛛抓了多少,和最终被编入索引的有多少。这两个数字长期对不上,说明站点某一段链路出了问题。差额本身不是故障,而是一条线索。
先把两个概念分清
抓取覆盖率,指的是蜘蛛在统计周期内实际访问并读取的 URL 数量。索引覆盖率,指的是这些 URL 中被搜索引擎判定为可以展示、并已进入索引的数量。前者衡量蜘蛛愿不愿意来、来不来得及读;后者衡量读完以后认不认这个页面。
抓取是过程,索引是结果。过程顺畅不等于结果理想,结果不理想也未必是抓取的问题。把两者混为一谈,就容易在错误的方向上做优化。
抓得多、索引少:差额通常出在哪
- 页面内容高度重复或模板化,蜘蛛读完判定价值不足。
- canonical、noindex 或 robots 规则把它们主动排除在外。
- 软 404 与空壳页:返回 200,但正文几乎没有实质内容。
- 参数页、排序页、筛选页生成大量近似 URL,被当作低质量变体。
- 页面虽然能抓,但主要依赖客户端渲染,蜘蛛拿到的是一段空壳。
这一类差额,问题往往不在抓,而在页。继续加大抓取力度只会放大浪费。
抓得少、索引也不多:先看抓取链路
如果抓取覆盖率本身就偏低,索引量自然上不去。常见原因包括:内链层级太深,重要页面没有稳定入链;Sitemap 长期不更新,里面躺着大量 404 或重定向;服务器响应偏慢,蜘蛛每次来访都容易超时;或者抓取额度被低质量目录页大量消耗。
抓取额度是被花掉的,不是被分配的。低价值 URL 抓得越多,高价值 URL 排得越靠后。
索引比抓取还多,也别急着高兴
偶尔会出现索引数量大于同期抓取数量的情况,这通常是统计口径与时间窗口造成的:索引数据反映的是历史累积,抓取数据反映的是近期行为。还有一种可能是,页面通过其他抓取通道被发现。这类差异一般不需要特别处理,观察趋势即可。
用一份分层清单来排查
- 先看总量趋势:抓取和索引两条曲线是长期背离,还是短周期波动。
- 再分目录看:把站点按栏目拆分,找出差额最大的那一块。
- 抽样看具体 URL:从差额目录里随机抽几十条,逐一确认状态码、canonical、正文长度。
- 核对内部链接:这些 URL 是否有稳定的站内入口,还是只能靠 Sitemap 被发现。
- 检查服务器响应:平均响应时间、超时比例、5xx 比例是否在可接受范围。
把动作落到能改的地方
差额本身没法一次性抹平,但可以逐段收窄。对内容重复的目录做合并或加 canonical;对空壳页补充实质内容,或者干脆去掉入口;对深层页面补内链,缩短从首页出发的路径;对服务器,优先解决超时,而不是先想着去调抓取频次设置。
每次只改一层,改完等两到四周再对比数据。同时改三五处,最后谁也说不清是哪一步起了作用。抓取与索引的差额,本质上是一份诊断清单,不是一个需要冲高的指标。