网站收录

收录体检不必全站跑:分层抽样核对的做法与常见误判

全站逐条核对收录状态成本高、结论还未必准。更实用的做法是先把 URL 分成若干层,再在每层抽少量样本,核对抓取记录、索引状态和内容一致性,把问题落到具体模板或入口上。文章还列出几种常见误判,比如把 site: 数字当收录总量、把抓取过当成已收录。

网站收录

收录体检不必全站跑:分层抽样核对的做法与常见误判

为什么建议用抽样,而不是全站核对

收录状态不是一次就能查清的固定属性。它随抓取频率、索引刷新、页面改动而变化,同一批 URL 今天查和下周查,结果可能不同。如果你的站点有几千甚至几万个 URL,逐条去核对既不现实,得到的也只是一张某一时刻的快照。

抽样要解决的不是“一共收录了多少”,而是“哪一类页面出了问题”。只要样本分层合理,几十个 URL 就能给出足够明确的方向,再决定要不要往下深挖。

先分层,再抽样

随机的 100 个 URL 参考价值有限,因为站内页面本来就不是同质的。商品页、文章页、列表页、帮助文档,它们的入口深度、更新频率、模板结构差别很大,混在一起抽,问题会被稀释掉。建议至少按下面几个维度切一层:

  • 按目录或模板分:不同栏目往往共用不同模板,出问题也常常是模板级的。
  • 按入口深度分:首页直接链接的页面,和需要点四五层才到的页面,抓取机会本就不同。
  • 按上线时间分:新上线的页面和两三年前的老页面,遇到的问题类型通常不一样。
  • 按内容供给方式分:手工编辑的页面和程序批量生成的页面,值得分开看。

分层不用追求精细,能区分出“这几类页面的处境不一样”就够了。层数太多,每层样本太少,反而看不出结论。

每层抽多少,核对哪几件事

每一层抽 10 到 20 个 URL,通常已经能看出趋势。样本从哪来?可以优先从站内链接、内链结构、sitemap 里各取一部分,尽量覆盖不同入口,而不是全部取自首页导航。

对每个样本,建议核对三件事,顺序上从抓取到索引再到内容:

  1. 抓取情况:日志里有没有搜索引擎的访问记录,返回的状态码是什么,抓取频率是持续的还是只有一两次。这一步回答问题:蜘蛛到底来没来。
  2. 索引状态:用站点查询或 URL 检查工具看这个 URL 是否有索引结果,同时确认页面的 canonical 指向哪里,是否指向了自己。这一步回答问题:抓取之后有没有进入索引。
  3. 一致性:索引里呈现的标题、摘要,和当前页面是否一致;如果索引的是旧版本,说明还没重新抓取或刷新。这一步回答问题:索引里的内容是不是当前的。

三件事分开看,比笼统判断“收录了没有”更有用。抓取缺失、抓取但未索引、索引版本陈旧,对应的处理方向完全不同。

几种常见的误判

  • 把站点查询的数量当作收录总量。它只是粗略估计,不同时间、不同查询方式的结果会有出入,拿它做同比环比很容易得出错误结论。
  • 把“抓取过”直接当成“已收录”。日志里出现访问,只说明页面被发现过,是否进入索引是另一回事。
  • 样本全来自浅层页面。如果样本都取自首页和导航,等于只测了最容易收录的那部分,深层页面的问题会被掩盖。
  • 只抽新页面。老页面的索引回收同样是收录健康度的一部分,只盯着新上线的内容,会漏掉这类信号。
  • 观察窗口太短。刚提交或刚改动的页面,短时间内没有出现在索引里属于正常现象,据此下结论容易误判。

什么时候值得扩大到全量核对

抽样是筛查,不是终点。当某一层的样本普遍异常,比如整个栏目的页面都没有抓取记录,或者某类模板的页面索引状态全部为空,这时候再对这一层做全量核对才有意义。反过来,如果各层样本表现接近,说明问题不在收录环节,继续扩大核对范围收益不大。

收录状态本质上是动态的,抽样核对的目的是尽快找到问题的边界,而不是给出一份精确的统计报表。

把核对结果按层记录下来,标注每层的问题是抓取不足、索引缺失还是内容不一致,下次再查时就有了对比基准。这比每次重新翻一遍索引报告要省事得多。