很多人看收录,习惯拿“已收录数 ÷ 站点总 URL 数”当一个指标。这个算法本身没错,但分母里装了什么,往往决定了结论是准的还是错的。一个内容站、一个电商站、一个工具站,URL 的构成完全不同,把这些页面不加区分地塞进同一个分母,得出的收录率既不能横向比,也不能纵向比。
分母为什么必须先分类
搜索引擎不会因为一个 URL 存在就给它同等的期待。核心内容页、自动生成的列表页、登录页、带参数的筛选页,它们被索引的价值本来就不一样。把不该被收录的页面也算进分母,等于自己给自己制造低分。反过来,如果分母里只剩下少数几个“必录”页面,数字好看,却反映不了站点的真实覆盖情况。
更实际的做法是:先按页面用途分组,每组单独算比例,再决定要不要动手。
四类页面,四种期待
核心内容页
文章、商品详情、教程、案例这类页面,是站点要参与搜索的主要资产。它们的收录情况应该单独看,并且看的是“该收录的有没有收录”,而不是“总数是多少”。低于预期时,重点查页面主体内容是否足够、是否存在近似重复的版本互相分流。
列表与聚合页
分类页、标签页、归档页、筛选结果页。这类页面的价值在于承接导航和长尾,但数量容易失控。判断标准不是收录多少,而是:有没有真实用户会从搜索进入,内容是否随筛选条件产生实质变化。条件组合无穷无尽时,收敛通常比铺开更划算。
功能与过渡页
登录、注册、购物车、提交成功、短链跳转。这些页面一般不需要出现在索引里,把它们放进分母只会拉低数字。适合用合适的指令和入口管理,让它们不成为收录议题。
历史遗留页
改版、下线、合并之后留下的旧 URL。它们的状态应该被明确:是 301 到新地址,还是返回 404/410,或者仍在被访问。悬而未决的旧 URL 会持续消耗抓取资源,也让收录统计变得模糊。
分组之后各自看什么
- 核心页:收录缺失的页面清单,以及它们各自的入口数量和内容完整度。
- 列表页:有搜索流量和没有搜索流量的比例,据此决定保留还是收敛。
- 功能页:是否还有被抓取记录,是否影响正常页面的抓取分配。
- 旧 URL:状态码是否统一,是否还有内链指向已经不存在的地址。
注意区分发现、抓取和索引这三个环节。日志里出现抓取,不代表已经进入索引;索引报告里显示“已发现但尚未抓取”,那往往是抓取预算和入口优先级的问题,和页面质量是两回事,处理顺序也不一样。
一个可以照做的顺序
- 导出站点 URL 清单,按目录和模板粗略归类,先分出上述四类。
- 给每一类单独设一个合理预期,比如核心页希望大部分被索引,功能页希望基本不被索引。
- 只对偏离预期的那一类做排查,避免全站一起改。
- 改动之后隔一段时间再看同一组数据,而不是立刻盯总量。
收录数字是结果,不是原因。分类是为了让这个结果能被解释,而不是为了让它变好看。
分母定清楚之后,收录率的涨跌才有意义。它涨了,你能说出是哪一类页面变好;它跌了,你也知道该先去查哪一组 URL,而不是对着一整站的数据反复猜测。