很多人看收录情况,最后只报一个数字:索引里有 8000 条。但这个数字本身说明不了任何问题——如果站点实际只有 6000 个有效页面,说明索引里混进了重复或无效 URL;如果有 5 万个有效页面,8000 就说明大面积没收录。所以真正有意义的指标是收录率,而收录率必须先有一个分母。
为什么不能只看收录数
收录数是一个绝对量,它会随站点规模、模板改版、URL 结构调整而波动。同样一个 8000,在不同站点上的含义可能完全相反。只有把分子(索引中的有效页面)和分母(应该被收录的页面)放在一起看,才能判断接下来该做什么。
分母的几种常见口径
- sitemap 全量:最容易拿到,但往往包含已经下线的页面、非规范 URL 变体,以及本就不打算收录的筛选页。作为分母会偏大。
- 数据库或后台全量:覆盖最全,但包含草稿、未发布、内部预览等根本不该出现在索引里的页面,同样偏大。
- 内链可达页面:更接近真实的可抓取范围,但会漏掉孤岛页面(只靠外链或历史收录存在)。作为分母会偏小。
- 日志中被动抓取过的 URL:反映搜索引擎实际见过什么,但包含大量参数组合和无效地址,噪音最大。
没有一个口径是完美的。可行的做法是选一个主口径,用其他口径做交叉校验,而不是每次换口径——那样趋势就不可比了。
建议先建一份目标收录清单
- 从主口径拉取候选 URL 全集。
- 按规范 URL 归并:大小写、结尾斜杠、跟踪参数、排序参数统一到一个代表。
- 剔除明确不想收录的:noindex 页面、robots 屏蔽路径、登录后页面、站内搜索结果页、纯筛选组合页。
- 标记每个 URL 的入口情况:有几个内链指向、是否在 sitemap 中、上次被抓取的时间。
- 给清单打上版本,固定更新周期,例如每月重新生成一次。
这份清单的价值在于:它让收录从模糊感觉变成可核对的列表,也让后续每一项改动都有对照物。
按状态分组,动作才明确
拿到清单后,把每个 URL 归到四种状态,处理方式完全不同:
- 已收录:暂时不用管,除非内容已变更、需要更新索引版本。
- 已发现,未抓取:问题通常在入口和抓取优先级。先补内链、确认 sitemap 是否正确,再看服务器响应是否拖慢了抓取。
- 已抓取,未编入索引:问题多半在页面本身。检查内容重复度、与站内其他页面的相似程度、页面是否有明确主题。
- 尚未发现:说明缺少入口,需要通过外链、内链或 sitemap 把它暴露出去。
把四类各占多少比例算出来,就已经知道该先动哪一块,不需要一上来就全站折腾。
收录率是过程指标,不是目标
追求 100% 收录既不现实也没必要。筛选页、低价值聚合页、已经过期的活动页,被排除在索引外通常是正常结果。真正要关注的是:有价值的那部分页面,收录率是否稳定,是否在持续改善。
如果分母本身没定义清楚,收录率的涨跌可能只是口径换了,而不是站点真的变好了或变差了。