网站收录

site 查询的数字和站长平台差一大截:先分清两把尺子各在量什么

site 查询返回的是估算值,站长平台的索引统计是另一套口径,两者差得多属于常态。本文说明数字差异的常见来源,并给出按“已发现、已抓取未编入、已编入”三种状态逐段核对的顺序,帮助判断是范围没对齐还是真的出了问题。

网站收录

site 查询的数字和站长平台差一大截:先分清两把尺子各在量什么

做收录核对时,很多人的第一反应是在搜索框里敲一个 site: 查询,看它返回的数字,然后拿去和站长平台里的收录数对比。结果往往差一大截,于是开始怀疑是不是掉了、是不是被处理了。其实在动手排查之前,先接受一个前提会更省事:这两个数字本来就不是同一套口径算出来的,差得多是常态,能对上反而是巧合。

一、两个数字分别是怎么来的

site: 查询返回的通常是一个估算值。搜索引擎在处理这类查询时,一般不把所有匹配 URL 全部遍历一遍再数给你看,而是基于索引分片做采样与近似,给出一个接近的数量级。它还会受查询词、访问入口、访问地区、当时索引合并进度的影响。所以它更适合用来判断“有没有量级上的异常”,而不适合拿来算精确的收录率。

站长平台里的数字来自索引库的统计口径,一般在固定时间点汇总,并且会把 URL 拆成“已发现”“已抓取但未编入索引”“已编入索引”等不同状态。它的判定规则、更新时间和统计范围(是否含子域、是否把 http 与 https 算成两套)都可能与 site 查询不同。

二、site 查询本身有哪些不确定

  • 采样与近似:量越大误差越明显,小站可能数量级对得上,大站差几万条并不稀奇。
  • 查询词影响:在 site: 后面再加词,返回的是子集,数字自然更小。
  • 入口不一致:不同地区、网页版与移动端,落到不同数据中心,看到的数字可能不同。
  • 变体合并:同一内容的多个 URL 版本被合并展示时,算一条还是按原始 URL 算,并没有统一说法。
  • 时间点错位:你查的时刻如果正好卡在索引批量更新前后,数字会跳动。

三、真正值得核对的是三种状态

与其纠结两个总量数字,不如按状态逐段核对,把问题定位到具体环节。

  1. 已发现:URL 通过外链或 sitemap 进来了,但还没排上抓取。这类问题通常出在内链深度和抓取预算分配上。
  2. 已抓取但未编入索引:蜘蛛来过了,内容也拿到了,但索引层判断价值不足。这时要回到页面质量、重复度、正文是否可读这几件事上。
  3. 已编入索引:能进这个状态,说明基础条件已经过了,后面的问题属于展示与排序层面。

把三段的量分别记下来,比记一个总和有用得多。总和变化时,你至少能立刻分辨是“发现”变差了,还是“编入”变严了。

四、数字对不上时,按这个顺序查

  1. 先确认两边统计范围是否一致:协议、子域、尾斜杠、大小写、是否带参数,是否同一批 URL。
  2. 确认时间点,站长平台的数据通常有延迟,先看它的数据截止到哪一天。
  3. 挑几条具体 URL 做样本,在两个地方分别查,看差异是普遍现象还是集中在少数页面。
  4. 如果差异集中在某类页面,比如列表、标签、筛选结果,优先怀疑 URL 变体过多导致的去重与合并。
  5. 只有当样本差异成规模、方向又一致时,再去怀疑抓取层或索引层出了异常。

五、几句提醒

site 查询可以当随手一看的体温计,但不适合写进报表当考核指标。它既不能证明站点被处理了,也不能证明收录变好了。更稳的做法是维护一份自己可控的 URL 清单,按上面三种状态定期抽样核对,看趋势而不是看单点数字。

数字对不上,多数时候不是出了故障,而是两把尺子量的是不同的东西。先把尺子对齐,再谈有没有问题。