网站收录

给收录做抽样体检:用一小批 URL 判断索引健康度

site: 数字天天在变,覆盖率报告又有延迟,光看总数很难判断收录到底正常不正常。与其盯着一个波动的大数字,不如按页面类型分层抽出 20-40 个 URL,逐个确认抓取状态、索引状态、索引里的规范网址和展示结果,再按抓取、索引、展示的顺序排查。本文给出样本挑选方法、五个检查项和几个常见误判。

网站收录

给收录做抽样体检:用一小批 URL 判断索引健康度

为什么建议抽样,而不是盯着总数

site: 返回的数字是一个估算值,会随查询词、地区、时间上下浮动;Search Console 的覆盖率报告同样有延迟,并且按分组给出,很难直接对上具体页面。盯着一个天天变的数字,通常判断不出站点是真的出了问题,还是只是统计口径在抖。

抽样体检的思路是:挑一小批有代表性的 URL,逐个确认它们在抓取、索引、规范三个层面上的状态,再看这批样本里问题出现的比例和集中方向。它给的不是一个分数,而是一组可以顺着往下查的线索。

样本怎么挑:按页面类型分层

随机抽 30 个 URL 意义不大,因为不同模板的页面收录表现天然不同。更实用的做法是先给站点分层,再从每层里挑代表:

  • 首页与核心栏目页
  • 各频道的内容详情页,每个频道取几条
  • 列表页与分页
  • 标签、筛选、聚合类页面
  • 最近新发布的页面
  • 最近改动过标题或正文的页面

每层挑 3 到 8 个,总数控制在 20 到 40 个之间。样本不必随机,但一定要能覆盖站点的主要页面类型。建议把这批 URL 记下来固定在表格里,后面重复使用。

每个样本查五件事

  1. 是否被抓取。在服务器日志或 CDN 日志里确认搜索爬虫最近是否访问过这个 URL,返回的状态码是什么。
  2. 是否在索引里。用 site: 精确查询该 URL,或在 Search Console 的网址检查工具里看状态。要留意的是,site: 查不到并不等于没收录,它只能作为提示。
  3. 索引里用的是哪个网址。看搜索结果展示的是不是你期望的版本,比如 www 与非 www、https、尾斜杠、带参数的变体。
  4. canonical 是否被采纳。如果页面自己声明了规范网址,检查索引里的规范网址是不是它,还是被替换成了别的。
  5. 标题与摘要。展示出来的标题摘要是否来自页面主要内容。被大量替换,往往说明内容主体没被准确识别。

怎么读结果

不要看绝对数字,看两件事:问题是否集中在某一层,以及和上一次抽样相比是变好还是变差。

  • 如果新页面这一层普遍没被抓取,问题多半出在站内入口和链接上。
  • 如果详情页被抓取了,但索引里的规范网址指向了筛选页或列表页,问题在 URL 与 canonical 层面。
  • 如果所有层表现一致地差,才需要往站点级因素上想,例如服务器稳定性、robots 配置、整体内容质量。
抽样体检的价值不在于给出一个健康分,而在于把“收录不好”这个模糊的判断,拆成某一层、某一环节上具体可查的问题。

排查顺序:抓取、索引、展示

顺序很重要,不要跳步。上一层没通,下一层的结论就不可靠。

  • 没被抓取:先确认内链是否可达、robots 是否误封、服务器是否稳定返回 200。
  • 抓取了没进索引:看页面质量与重复程度,是否与其他页面高度相似,站内是否明确了主版本。
  • 进了索引但展示不对:检查标题摘要、结构化数据、canonical 与同页多址的情况。

每次只解决当前这一层的问题。修完之后隔一段时间,用同一批 URL 再抽一次,通过前后对比来验证改动是否有效,而不是改完当天就下结论。

几个常见误判

  • 把 site: 的结果数量当成精确的收录量。
  • 用一次查询就下结论,忽略地区、语言、设备差异带来的变化。
  • 把爬虫来得频繁当成收录良好,其实抓取和索引是两件事。
  • 页面刚改完就检查,没有给重新抓取和更新留出时间。

把抽样做成固定动作,比如每月一次、每次使用同一批样本,长期看趋势,会比每天刷新某个数字有用得多。它不会让收录立刻变好,但能让你在问题还小的时候先发现它。