网站收录

收录数字对不上:后台报告、site 查询与抓取日志的口径差异

后台索引报告、site 查询和抓取日志经常给出三个不一样的数字。它们统计的对象本来就不同:一个看索引库,一个看可检索结果,一个只看访问记录。先把口径对齐,再按时间差、版本合并、抓取与收录的界限逐项核对,才能判断站点到底出了什么问题。

网站收录

收录数字对不上:后台报告、site 查询与抓取日志的口径差异

做收录统计时,几乎每个人都会遇到同一个问题:站长平台后台显示已编入索引 X 条,site 查询给出 Y 条,抓取日志里蜘蛛访问过的 URL 又是 Z 条。三个数字往往差得很远,于是有人开始怀疑是不是被降权,或者怀疑工具坏了。多数情况下,问题出在口径——这三个数字统计的根本不是同一件事。

三个口径分别在数什么

索引报告:以搜索引擎自己的索引库为准,通常按「已编入索引」「已抓取但未编入索引」「已发现」「已排除」等状态分组。它最接近「收没收」,但有更新延迟,并且会把同一内容的多个版本合并计算。

site 查询:这是检索结果层面的估算值,只反映「现在能搜出来的页面」。它会受查询触发方式、数据中心、结果去重、个性化等因素影响,短时间内上下浮动很正常,不适合当成精确计数。

抓取日志:记录蜘蛛实际访问的 URL 和状态码,只能证明「来过」,不能证明入库。日志里 200 响应很多的站点,索引量原地不动的例子并不少见。

先确定你要回答的是哪个问题

  • 想知道有多少页面进了索引:看索引报告,别用 site 数字下结论。
  • 想知道某个 URL 现在能不能被搜到:用 URL 检查类工具,再配合 site 加具体 URL。
  • 想知道页面有没有被爬:看日志,配合服务器状态码。
  • 想知道抓取是否顺利:日志加状态码分布,而不是收录数字。

差异的常见来源,按核对顺序排

  1. 时间差。索引更新不是即时的,抓取、入库、可检索之间通常隔一段时间。先看对比的两个数字是不是同一时刻取的。
  2. 版本合并。协议、大小写、尾斜杠、参数不同但内容相同的 URL,在报告里可能被合并成一条,在日志里却是多条,于是数字天然对不上。
  3. 抓取不等于收录。日志里的 200 只说明抓到了,页面质量、内容重复度、结构完整度都会影响是否编入索引。
  4. 收录不等于可见。进了索引也可能因为查询词、地域、结果去重而不被展示,site 查询数字偏小属于正常现象。
  5. 统计范围不同。报告可能只覆盖某个目录或子域,站点地图只包含你提交的部分,日志则包含所有被访问的路径。范围没对齐,比较就没有意义。
抓取日志回答「来过没有」,索引报告回答「收没收」,site 查询回答「现在搜不搜得到」。把问题对应到正确的口径,再谈数字差多少。

实操:把差异收敛到可解释

  • 固定一个基准口径,例如以索引报告为准,其他数字只作参考。
  • 抽一批具体 URL,逐个查索引状态和最近一次抓取时间,比整体数字更容易看出规律。
  • 记录对比的时间点,隔几天再看一次,避免被正常波动误导。
  • 检查 robots、canonical 和状态码,确认没有把页面挡在抓取或收录之外。
  • 发现大片「已发现未抓取」或「已抓取未编入」,再回头处理入口信号与页面质量。

几个容易误判的情形

  • 抓取量涨、收录没涨:多半是新 URL 增多但质量不够,或者大量是参数、筛选类页面。
  • 收录数涨、流量没涨:新增收录的可能是不带搜索需求的页面,与曝光没有直接关系。
  • 数字突然跳变:先排除报告口径调整、数据延迟,再考虑站点自身变化。

收录数字只是线索,不是结论。把三个口径的问题分清,再按上面的顺序逐项核对,通常能把「对不上」变成几条具体、可处理的事项。