网站收录

收录率的分母从哪来:先列一份“应该被收录”的清单

收录数只是一个绝对量,单独看没有意义。本文说明收录率的分母可以从哪几种口径来、各自有什么偏差,以及如何用一份固定的目标收录清单,把页面按已收录、已发现未抓取、已抓取未编入、尚未发现分组,再决定先处理哪一块。

网站收录

收录率的分母从哪来:先列一份“应该被收录”的清单

很多人看收录情况,最后只报一个数字:索引里有 8000 条。但这个数字本身说明不了任何问题——如果站点实际只有 6000 个有效页面,说明索引里混进了重复或无效 URL;如果有 5 万个有效页面,8000 就说明大面积没收录。所以真正有意义的指标是收录率,而收录率必须先有一个分母。

为什么不能只看收录数

收录数是一个绝对量,它会随站点规模、模板改版、URL 结构调整而波动。同样一个 8000,在不同站点上的含义可能完全相反。只有把分子(索引中的有效页面)和分母(应该被收录的页面)放在一起看,才能判断接下来该做什么。

分母的几种常见口径

  • sitemap 全量:最容易拿到,但往往包含已经下线的页面、非规范 URL 变体,以及本就不打算收录的筛选页。作为分母会偏大。
  • 数据库或后台全量:覆盖最全,但包含草稿、未发布、内部预览等根本不该出现在索引里的页面,同样偏大。
  • 内链可达页面:更接近真实的可抓取范围,但会漏掉孤岛页面(只靠外链或历史收录存在)。作为分母会偏小。
  • 日志中被动抓取过的 URL:反映搜索引擎实际见过什么,但包含大量参数组合和无效地址,噪音最大。

没有一个口径是完美的。可行的做法是选一个主口径,用其他口径做交叉校验,而不是每次换口径——那样趋势就不可比了。

建议先建一份目标收录清单

  1. 从主口径拉取候选 URL 全集。
  2. 按规范 URL 归并:大小写、结尾斜杠、跟踪参数、排序参数统一到一个代表。
  3. 剔除明确不想收录的:noindex 页面、robots 屏蔽路径、登录后页面、站内搜索结果页、纯筛选组合页。
  4. 标记每个 URL 的入口情况:有几个内链指向、是否在 sitemap 中、上次被抓取的时间。
  5. 给清单打上版本,固定更新周期,例如每月重新生成一次。

这份清单的价值在于:它让收录从模糊感觉变成可核对的列表,也让后续每一项改动都有对照物。

按状态分组,动作才明确

拿到清单后,把每个 URL 归到四种状态,处理方式完全不同:

  • 已收录:暂时不用管,除非内容已变更、需要更新索引版本。
  • 已发现,未抓取:问题通常在入口和抓取优先级。先补内链、确认 sitemap 是否正确,再看服务器响应是否拖慢了抓取。
  • 已抓取,未编入索引:问题多半在页面本身。检查内容重复度、与站内其他页面的相似程度、页面是否有明确主题。
  • 尚未发现:说明缺少入口,需要通过外链、内链或 sitemap 把它暴露出去。

把四类各占多少比例算出来,就已经知道该先动哪一块,不需要一上来就全站折腾。

收录率是过程指标,不是目标

追求 100% 收录既不现实也没必要。筛选页、低价值聚合页、已经过期的活动页,被排除在索引外通常是正常结果。真正要关注的是:有价值的那部分页面,收录率是否稳定,是否在持续改善。

如果分母本身没定义清楚,收录率的涨跌可能只是口径换了,而不是站点真的变好了或变差了。