很多人判断收录情况,第一反应是在搜索框里敲一次 site 查询,数字涨了就放心,掉了就立刻去改内链、改模板、调 robots。实际上,site 返回的是一个估算值,它和 Search Console 报告的索引量、服务器日志里的抓取量,是三套不同的口径。三个数字对不上是常态,长期完全一致反而少见。
先把三种口径分清
site 查询:抽样估算,带地域和时间差
site 的数字受查询节点、地域、时间点影响,同一天不同时间查都可能不一样。它还会做去重和抽样,所以更适合看量级和趋势,不适合当成精确清单。想确认某个具体 URL 在不在索引里,直接搜它的完整标题或一段独有句子,比看总量更有意义。
索引报告:区分“已编入索引”和“已抓取但未编入索引”
索引报告里的“已编入索引”才是真正进了索引的页面数,而“已抓取——尚未编入索引”说的是抓过了但没被收录。这两项性质完全不同:前者更偏索引侧问题,后者多半与内容质量、重复度或价值判断有关。把两者加在一起当收录量,是最常见的误读。
服务器日志:只说明抓取,不说明收录
日志里蜘蛛来过、返回 200,只能证明抓取发生过;是否进索引,要另外验证。抓取量突然变多,可能是它在反复确认某个不稳定的页面,未必是好事。
三个数字对不上,通常出在这些地方
- 协议和域名变体:http、https、www、不带 www 在某些查询里可能被分开统计。
- 索引分片与更新延迟:索引不是实时同步的,一段时间内的数字波动属于正常刷新。
- 重复内容折叠:被判定重复而折叠的 URL,在不同口径里可能一边算一边不算。
- 抓取与收录的时间差:日志统计的是爬虫行为,索引统计的是处理结果,中间隔着一整条管线。
一套不容易被数字带偏的排查顺序
- 固定口径:统一域名变体、统一查询方式、统一时间窗口,再比较数字。
- 看趋势不看单点:连续记录四到八周,比两天的涨跌可靠得多。
- 抽样验证:从各页面类型里各抽若干 URL,手工确认是否真的在索引中。
- 对照日志:抓取量和索引量同步下降,更像抓取层问题;抓取正常而索引下降,往内容与规范化方向查。
- 检查变更:这段时间内是否动过 canonical、noindex、robots、模板或 URL 结构。
哪些波动可以先不管
- 总量在百分之几以内来回浮动,页面类型分布没有明显变化。
- 只是新发布的页面还没被处理,老页面保持稳定。
- 对应的是同一批低价值 URL 反复进出。
需要尽快处理的则是另一类:某一类页面整体消失、索引量持续多周下行、日志里出现大量异常状态码。
收录数字是观察工具,不是考核指标。先确认自己在看哪一种口径,再决定要不要动手。
实操上,建议维护一份最简单的收录台账:每周固定时间记录 site 量级、索引报告里的主要分类、日志抓取量,并按页面类型分开记。数据放在一起看,才不容易被单一数字牵着走。