网站收录

收录数量对不上:站长工具、site 指令与日志口径的核对顺序

站长平台、site 指令和抓取日志给出的收录数字经常对不上,原因多半是统计口径不同。本文先说明三个数字各自在统计什么,再给出统一时间窗口、统一域名版本、抽样比对 URL、区分抓取与索引的核对顺序,并指出哪些差异属于正常波动、哪些才值得投入排查。

网站收录

收录数量对不上:站长工具、site 指令与日志口径的核对顺序

做站点运营的人经常遇到这样一幕:站长平台显示已收录两万条,site 指令查出来只有几千条,日志里蜘蛛抓过的 URL 又是另一个数量级。三个数字对不上,很容易让人怀疑站点出了大问题。多数情况下不是谁统计错了,而是三方统计的根本不是同一件事。

三个数字各在统计什么

站长平台的索引量

它对应的是“已编入索引、有资格参与展现”的 URL 数量,通常是估算和平滑处理后的结果。更新有延迟,也不保证每一条都能单独查得到。它的价值在趋势,不在绝对值。

site 指令的返回数

site 返回的是一个估算值,会随查询节点、时间点、查询写法以及是否加目录而波动。同一站点上午和下午差出一半并不罕见。它适合做抽样验证,不适合当收录基准。

日志里的抓取数

抓取和索引是两个环节。日志记录的是蜘蛛来过多少次、抓走多少 URL,其中相当一部分本来就不该进索引,比如参数页、重复页、无实质内容的页面。拿抓取量对比收录量,相当于拿进货单对比上架商品数,天生对不上。

核对差异的四个步骤

  1. 统一时间窗口。日志取最近七天的完整数据,平台数据取同一时间段,避免拿今天的抓取量和上个月的收录量作比较。
  2. 统一域名与协议版本。http、https、www、非 www,以及子域和移动端域名,如果分别算在两套口径里,差值会凭空出现。
  3. 抽样比对具体 URL。从日志里挑二十到五十条已抓取的 URL,逐个查收录状态,看是确实没收录,还是收录了但统计里看不到。这一步能把笼统的差异落到具体页面上。
  4. 区分抓取、索引、展现。被抓过不等于被索引,被索引不等于有展现。三个环节各自有各自的过滤条件,混在一起看只会得到一团乱麻。

三类常见的“假差异”

  • 带参数的 URL。跟踪参数、排序参数生成的大量变体,有的被合并统计,有的被单独计算,差额往往来自这里。
  • 模板类页面。分页、标签、筛选页在不同工具里的归属规则不一致,容易造成几千条的出入。
  • 统计延迟。平台数据往往滞后数天到两周,刚发布的页面在平台里查不到,属于正常现象。

什么样的差异才值得动手

如果只是某一次查询对不上,通常可以放过。真正需要处理的是方向上的一致性变化:索引量连续两到四周下滑,同时日志显示抓取正常、返回码正常;或者新增内容长期抓取正常却始终不进索引。前者要查内容质量与重复问题,后者要查页面本身是否存在阻碍索引的设置。

反过来,索引量正常而 site 查不到,多半只是估算问题,不必为了一个查询结果去改站。

收录数字是估算,趋势才是信号。单个数字的绝对值参考意义有限,连续的方向变化才值得投入排查成本。

把核对变成固定动作

与其每次看到差异就慌,不如把它变成每周一次的固定动作:记录平台索引量、抽样若干 URL 的收录状态、统计日志里的抓取分布。坚持几周之后,你会知道自己的站点“正常”是什么样子,任何偏离都会第一时间被识别出来,而不是等到流量掉了才开始翻日志。