site: 的数字是查询结果,不是统计报表
不少人习惯在搜索框输入 site: 加域名,看返回的“大约多少条结果”,把它当作收录量。这个数字确实能反映一些情况,但它本质上是搜索结果数,不是索引库的统计数。引擎返回的是能作为结果展示出来的页面,中间会经过筛选、去重和折叠,和索引里实际存了多少个 URL,本来就是两回事。
差异通常来自这几处
- 结果数是估算值。同一个站,换地区、换语言、换设备再查,数字可能不一样。
- 只统计能作为结果返回的页面。有些页面虽然进了索引,但没有合适的查询词匹配,或被认为不适合展示,就不会出现在结果里。
- URL 变体会被折叠或分散计数。带参数的地址、多个入口指向的同一页面,可能算成一条,也可能算成几条。
- 索引有延迟。你查到的可能是几天前的快照,刚上线或刚改动的页面未必反映得出来。
- 站点分散在多个域名或子域时,site: 只覆盖你输入的那一个。
搜索控制台的索引报告是另一个口径
后台里的“已编入索引 / 未编入索引”同样不是精确到个位的统计,它通常基于抽样和估算,分类数字会浮动,也会滞后。它真正的价值在于看结构:未编入索引的页面分别卡在什么原因上——是被 robots 挡了、是重复内容被合并了、是抓取后判定价值不高,还是根本还没被抓到。
所以两个数字对不上,多数时候不是站点出了问题,而是拿了两把不一样的尺子在量同一件事。
想判断某个页面进没进索引,看这几点
- 直接查那个 URL。用后台的网址检查工具,或用 site: 加完整地址精确查一次,比盯着总数有用得多。
- 看服务器日志。蜘蛛有没有抓、抓了几次、返回什么状态码,这些是你能拿到的一手信号。
- 看索引报告里的原因分布。重点看“已抓取,尚未编入索引”和“已发现,尚未抓取”两类占比的变化,而不是总数本身。
- 看趋势,不看单点。隔几天看一次走向,比每天盯一个波动的数字可靠。
两个容易踩的坑
数字一降就急着改站
收录数字的短期波动,可能只是查询抽样变化或索引更新。这个时候批量改标题、改内链、加大推送,反而会把本来正常的页面搅乱。先确认是不是真有一批 URL 从索引里消失了,再决定要不要动手。
拿 site: 数量和别的站比
不同站点的规模、结构、内容量都不一样,这个数字既不适合横向比较,也不适合当成考核指标。对内做趋势参考可以,对外做对比基本没有意义。
收录相关的数字大多是估算。与其追一个精确值,不如盯住具体页面:它被发现了没有、被抓了没有、抓完之后发生了什么。
一个简单的自查顺序
- 挑几个有代表性的 URL,逐个确认索引状态。
- 对照日志,看这些 URL 最近有没有被抓取。
- 在索引报告里看它们落在哪个分类,原因是什么。
- 把同类问题的页面归到一起成批处理,别一页一页改。
- 改完之后隔一段时间再看趋势,不要当天就下结论。
收录这件事很少一步到位。工具给的是线索,不是结论;把线索落到具体 URL 上,才知道下一步该做什么。