很多人把“收录数量”当成一个可以盯住的指标,但这个数字本身包含的信息量很低。同一批页面,今天多两条明天少三条,可能只是索引在正常调整;真正需要处理的问题,往往藏在“应该被收录却没被收录”的那一小撮页面里。想判断站点健康度,比起看总量,更实用的是先把页面分好类,再算一个能横向比较的收录率。
为什么“收录数量”这个数字不能直接用
搜索引擎给出的已编入索引数量是一个估算值,统计口径不公开,也不保证稳定。它会受到抓取周期、索引分层、页面合并等因素影响。拿它做趋势参考可以,但用它推导具体动作,通常会得出错误结论。比如总量下降,可能是删掉了一批参数页,反而是好事。
第一步:先划定“应该被收录”的页面集合
把一个站点的页面按功能分成三类:
- 必须收录:核心内容页、栏目入口页、有独立价值的聚合页。
- 可以收录:有内容但同质化较高的列表页、多页内容的后续分页。
- 不该收录:筛选参数页、排序结果页、站内搜索结果页、测试页、登录后页面、重复的打印页。
只有第一类和部分第二类,才应该进入收录率的计算。把第三类也算进去,只会得到一个永远偏低的数字,然后逼着自己去做无意义的提交。
第二步:把不该收录的页面真正挡住
把它们分出来只是第一步,配置层面也要跟上。常见做法是按情况选择:
- 筛选、排序、追踪参数造成的重复 URL,用 canonical 收口到主版本。
- 站内搜索结果页、登录后页面,用 robots 或 noindex 明确挡掉。
- 已经没有意义的历史页,处理成 404 或 410,不要再统一重定向到首页。
这一步没做完,后面统计出来的收录率都是被污染的。
第三步:算一个可以横向比较的收录率
不用全站统计,成本太高也没必要。按目录或按模板抽样即可,比如从内容页目录里随机取 50 到 100 条 URL,逐条确认是否在索引中,再算比例。
查询方式上,site: 命令适合快速判断,但不精确;URL 检查工具显示的状态更接近真实情况,但一次只能看一条。两者结合用:前者筛异常,后者做确认。
收录率是一个内部对比指标。同一个站点不同目录之间比、同一目录不同时间比,才有参考价值,跨站比较意义不大。
第四步:把未收录页面按原因分开
剩下的未收录页面,原因差别很大,处理方式也完全不同:
- 已发现未抓取:站内链接有入口,但抓取优先级不够。可以补内链、从更高权重的页面导流,或放进 sitemap 提醒。
- 抓取过但未编入索引:通常是内容层面的判断,页面太薄、和别的页面高度重复、缺少独立价值。
- 被规则挡掉:noindex、robots、canonical 指向了别处。这是配置问题,改完还要等重新抓取。
- 返回异常状态:404、软 404、超时。先修服务端和状态码。
把这四类混在一起看,就会出现“我明明提交了为什么不收录”这类无从下手的问题。
几个常见的判断误区
把收录率 100% 当成目标
正常站点本来就有一部分页面不会被收录,尤其是分页和聚合页。追求满额收录,往往会把精力花在低价值页面上。
只看总量,不看结构
总量持平,可能内部已经换了一批:旧内容掉出索引,新内容补进来。只看总数看不出这个变化,按目录分组看才能发现。
一个可以固定执行的检查顺序
- 锁定一个固定的页面集合(比如内容页目录),不要每次都换样本。
- 抽样 50 到 100 条 URL,记录当前状态。
- 对未收录页面逐条归类,落到上面四类中。
- 只针对“应该收录但没收”的页面动手:补内链、改内容、修配置。
- 记录改动日期,隔 4 到 6 周再抽样一次,对比同一集合。
这样做的好处是,你得到的不是一个每天都在跳动的数字,而是一组能对应到具体动作的页面清单。收录这件事,能落地的部分从来都是“哪些页面该进来、哪些不该进来”,而不是总量本身。