做收录核对时,最容易看错的指标是“总收录量”。几十万条 URL 进了索引,看着很健康,但把地址按模板拆开一看,绝大部分是列表页、分页、标签聚合页,真正承载内容的详情页只占很小一部分。这种结构下,站点表面上收录充足,实际能被搜到的有效页面并不多。
先看清收录里的页面都是哪一类
在动手改之前,先把索引里的地址拉出来,按模板归类。不要只看“收录了多少条”,而要看“每一类各占多少”。
分组时至少要把这几类分开
- 内容详情页:文章、商品、问答等单条内容
- 列表页:栏目首页、分类页
- 分页:列表的第 2、3、N 页
- 标签与聚合页:由筛选、标签、作者等维度自动生成
- 功能页:搜索结果地址、排序参数页
分组后分别算两个数:这类 URL 一共有多少、其中进了索引的有多少。两个数一对比,问题通常立刻显形——要么是详情页整体收录偏低,要么是聚合类地址把总量撑了起来。
列表页为什么容易被大量收录
列表页有几个天然优势:入口多、更新频繁、被蜘蛛反复访问,而且往往挂在导航和面包屑里,从首页几步就能到。详情页则相反,入口依赖列表页,越靠后的内容越难被走到。当列表分页很深时,详情页的链接会被压到很后面,抓取优先级自然靠后。
详情页收不进去,常见卡点
- 入口太浅或太深。只有翻到列表第 N 页才出现链接,等于没有稳定入口。
- 被规则拦住。robots、noindex、canonical 指向别处,任何一条都会让页面出局。
- 内容与列表摘要重合。详情页正文和列表页里的摘要几乎一样,搜索引擎没有理由单独保留它。
- 详情页彼此相似。同模板批量生成、只换少量字段的页面,容易被判为重复。
- 返回状态不对。空内容返回 200,或者未登录就跳登录页,都会影响判断。
处理顺序:先通路,再内容,最后收敛
- 确认详情页至少有一个固定入口,不依赖翻页。可以在栏目首页、相关推荐或站点地图里给出稳定链接。
- 逐个排查拦截规则,把误拦的放开,把确实不想收的明确标注。
- 补足详情页的独立信息,让它比列表摘要多出可读的实际内容,而不是模板字段的堆砌。
- 判断聚合类地址的去留。分页、筛选参数这类页面,如果不带来独有信息,考虑收敛入口或做规范化处理。
- 改完等一段时间再对比同一组数据,不要当天就下结论。
留一份能持续对比的基线
把分组方式、统计日期、每类 URL 的总数和收录数记下来,隔一到两周用同样的口径再算一次。比值的变化比绝对数字更有参考价值:详情页占比在上升,说明方向对了;只是总量在涨而结构没变,多半还是聚合页在扩。
收录核对看的是结构,不是总数。总量涨得快不等于有效页面变多,先把每一类的占比算清楚,再决定要动哪里。