网站收录

整站收录上不去:先分清是站点级问题还是页面级问题

收录率长期偏低时,逐页排查往往效率不高。抓取和索引是两个层面的判断:抓取意愿更多取决于站点,能否入索引才落到页面。本文给出把两者拆开看的方法,以及从 URL 总量、无效页面、内容区分度到内链的自查顺序,帮你判断该修站点还是修页面。

网站收录

整站收录上不去:先分清是站点级问题还是页面级问题

收录这件事,很多人习惯一页一页去查。但如果整站收录率长期偏低,逐页排查往往效率不高——因为问题可能根本不在单个页面上。

抓取和索引是两套判断。爬虫愿不愿意来、愿不愿意抓,更多是站点层面的结果;抓到之后编不编入索引,才落到页面层面。把这两层混在一起看,很容易把站点问题当成页面问题反复折腾。

先看比例,再看绝对数

已收录数量本身说明不了什么。一个 500 页的站收录 300 页,和一个 5 万页的站收录 3 万页,前者的问题通常更值得先处理。

  • 已提交的 URL 数 对比 实际被发现的 URL 数
  • 被发现的 URL 数 对比 被抓取的 URL 数
  • 被抓取的 URL 数 对比 编入索引的 URL 数

每一段落差对应的原因不一样。发现多、抓取少,问题多半在站点;抓取多、索引少,问题更可能在页面。

站点级问题的常见表现

抓取量被无效 URL 吃掉

参数页、筛选页、日历页、站内搜索结果,这类 URL 数量容易在短时间内膨胀。爬虫的抓取量是有限的,被这些页面占满之后,真正需要收录的内容页反而排不上队。

整体质量评价偏低

搜索引擎对站点有一个整体判断。当站内大量页面内容稀薄、模板高度雷同、或者主要靠拼凑整合而成时,这个判断会影响到新页面的收录速度,即使新页面本身做得不错。

单页质量决定它值不值得被收录,站点质量影响它多快被考虑到。两者不是替换关系。

怎么区分是站点问题还是页面问题

一个简单的办法:拿站内几个结构、内容深度都正常的老页面,看它们的收录状态。

  • 老页面收录正常,只有新页面进不去,更可能是抓取节奏或新页面自身的问题
  • 老页面也开始掉,或者一直没收全,更可能是站点层面的问题
  • 同类模板的页面收录情况高度一致,说明模板层面有共性问题
  • 表现零散、没有规律,逐页看反而更有效率

自查顺序

  1. 先用站点地图和日志,把发现、抓取、索引三段数据分开看,不要混着判断。
  2. 确认 robots.txt、noindex、canonical 没有拦住不该拦的页面。
  3. 统计站内 URL 总量,看看有多少是参数、排序、筛选这类低价值页面,该收敛的收敛。
  4. 抽查内容页的正文是否有实质性差异,模板重复度过高的部分考虑合并或改写。
  5. 再看内链:重要页面是否还有足够入口,层级是否过深。

这个顺序的逻辑是先排除被挡住和被稀释两种情况,再去动页面本身。反过来做,很容易在页面上改了一轮,站点结构的问题仍然摆在那里。

不要指望一步到位

站点层面的信号调整,见效周期通常以月计,而且不会因为做对一件事就立刻改变。与其盯着收录数字每天波动,不如把注意力放在 URL 总量是否收敛、内容是否有区分度这两件事上。

另外,收录数量也不是越多越好。一批本身没有检索价值的页面进了索引,对整站未必是加分项。该收的收全,不该收的挡在外面,这个平衡比单纯追求数量更有意义。