做收录排查时,最容易踩的坑是拿两个不同来源的数字做减法:站长平台显示一万,第三方工具显示六千,site 查询又只给一个模糊区间,于是开始怀疑站点被降权。多数情况下这不是站点变差了,而是几套数字本来就在数不同的东西。
先分清三套常见口径
搜索引擎后台的索引数据
站长平台展示的是搜索引擎自己认账的索引情况,通常按“已编入索引”“已发现未抓取”“已抓取未编入索引”等状态分类。它的特点是准确度相对高,但更新有延迟,而且只覆盖自己能看到的范围,比如子域、协议版本可能分开统计。
site 查询给出的结果
site 查询本质上是估算值,不是精确计数。搜索引擎会为了性能做抽样,最后一页的数字经常前后跳动,同一站点在不同时间、不同地区查询结果也可能有出入。它适合看趋势和大致量级,不适合当成绝对值来做决策。
第三方工具的统计
第三方工具多数依靠采样、历史数据库或自有爬虫推算,覆盖范围和更新节奏与搜索引擎不同步。它对你和竞品用同一套逻辑,所以用来做横向对比比较合适,用来判断自己站点是否“掉了三千条”就不太靠谱。
数字差异通常来自这几个地方
- 估算与实测的区别:site 是估算,后台是实测,两者天生不相等。
- 更新延迟:新页面编入索引、旧页面被移除,各数据源的反应速度不同,差几天很正常。
- 过滤规则:近似重复、参数页、低价值页面可能被抓取但不进入可检索的索引,统计口径不同就会差一截。
- URL 归一方式:带与不带 www、http 与 https、末尾斜杠、大小写,在不同工具里可能被合并,也可能被当成两条。
- 范围边界:子域、多语言目录、CDN 域名算不算在内,各家默认设置不一样。
什么时候可以放过,什么时候该动手
如果两个数字差在百分之十几以内,而且趋势方向一致,基本可以忽略。真正值得动手的信号是:后台显示“已发现未抓取”持续增长、重要栏目页在后台查不到、索引量连续几周单向下滑,或者某个改版前后出现断崖式变化。这些是站点侧的问题,和工具口径无关。
判断标准不是“哪个数字更高”,而是“这个变化有没有对应的站点动作”。没有动作却有大变化,才需要查。
一套可用的自查顺序
- 先固定一个主口径,建议用搜索引擎后台,把它当作唯一的事实来源。
- 确认查询范围一致:是否包含子域、是否区分协议、是否按目录筛选。
- 对差异最大的那一批 URL 抽样,人工打开看它们是否真的能被搜到。
- 检查抽样页面是否存在 canonical 指向别处、noindex、参数重复等常见问题。
- 把差异按类型归类,而不是按数量纠结:是延迟、是过滤,还是真的没被收录。
- 只对确认有问题的那一类动手,改完观察两到四周再对比,不要同时改多项。
落地建议
与其每天对比不同工具的数字,不如固定一张自己的收录表:选几十个有代表性的页面,包括首页、栏目页、重要详情页和新增内容,每周记录一次它们在后台的状态。样本量不大,但趋势足够清晰,也不会被第三方工具的估算波动带着走。收录问题多半是慢变量,稳定观察比频繁换工具更有用。