网站收录

三个地方看到的收录数不一样:搜索指令、后台报告和服务器日志各在统计什么

搜索指令、搜索后台报告和服务器日志经常给出三个不同的收录数字。差异大多来自统计口径、时间窗口和规范化处理,而不是有人算错了。先弄清每个数字在数什么,再决定要不要排查,能避免把正常差异当成故障处理。

网站收录

三个地方看到的收录数不一样:搜索指令、后台报告和服务器日志各在统计什么

做收录检查时,很容易遇到这种情况:搜索指令查出来的数量、后台报告里的索引页面数、服务器日志里被蜘蛛抓过的 URL 数,三个数字对不上。有人第一反应是数据出错或者站点出问题,但多数时候,只是三个来源在数不同的东西。

三个数字各自在数什么

搜索指令:估算值

site: 查询给出的是一个粗略量级。它受查询词、时间、地区影响,同一站点不同时间查、加不加关键词,数字都会变。搜索引擎会对近似重复的结果做折叠,也会过滤掉一些不展示的 URL,所以你得到的往往是一个被处理过的近似值,不是资产清单。

后台报告:处理后状态

搜索后台的索引报告按状态分类,例如已编入索引、已发现但未抓取、已抓取未编入索引、重复网页等。它统计的是已经被处理过的 URL,并且会把重复版本归到它选定的规范页上。报告存在延迟,处理完成到状态更新之间通常隔一段时间。

服务器日志:抓取动作

日志记录的是蜘蛛实际请求了哪些 URL、请求了几次、返回什么状态码。它只反映抓取,不反映收录。一个 URL 被反复抓取,仍然可能因为质量或重复问题无法进入索引;反过来,一个页面长期被收录却很少被抓,日志里也可能看不到它。

对不上的常见原因

  • 时间窗口不同。日志是实时写入的,后台报告通常滞后一天到几天,查指令得到的又是当下这一刻的估算。
  • 范围不同。日志包含被 robots 屏蔽的、带参数的、非规范的 URL,这些通常不会出现在索引报告里。
  • 规范化合并。多个近似 URL 在报告里会被合并成一个规范页,日志却会把每个版本分别记一笔,数量自然差得多。
  • 采样与估算。查指令的数字本身就不是精确统计,用来做趋势参考可以,用来做逐条核对不行。

几种典型差异怎么读

指令数量远大于报告数量

常见于参数多、筛选页多、分页深的站点。指令可能把一些被折叠或被过滤的 URL 也算进去,报告则只统计处理过并归类的。这种差距通常不代表收录变好或变坏。

报告数量大于日志抓取量

索引报告里包含大量很久以前抓取、状态保留至今的页面。如果近期日志中几乎没出现这些 URL,说明的是它们不再被频繁抓取,而不是状态一定变了。

日志抓取很多,报告却不见增长

这才是需要认真看的情况。抓取不等于收录,重点检查这几处:页面返回的状态码是否稳定、是否误加了 noindex、正文是否被模板挤到很靠后、与站内其他页面是否高度相似、是否需要登录或依赖大量脚本渲染。

建议的核对顺序

  1. 先确认比较的是同一批 URL,最好导出清单再比对,不要用总数比总数。
  2. 再看时间窗口,把日志按天切片,和报告的状态更新日期对齐。
  3. 然后区分“抓取过”和“被处理过”,把日志里抓过但报告里没有的 URL 单独列出来。
  4. 最后抽二十到五十个样本页,逐个看状态码、指令、正文与重复情况,比看大数字更有用。

该以哪个为准

没有哪个数字是绝对准确的。日志用来判断蜘蛛来不来、来抓什么,报告用来判断处理结果和状态分类,查指令只适合粗略感受量级。三者配合看,才能拼出完整画面。

三个数字不一致本身不是问题,问题是在不知道口径的情况下拿它们互相证明。先问“这个数字在数什么”,再决定要不要排查。