网站收录

列表页收了一堆,详情页却没几个:收录核对先看层级之间的配比

收录总量看着不少,拆开却几乎全是列表页和聚合页,详情页没几个。本文讲收录核对时如何按模板分组、算清各层级配比,并给出从入口、拦截规则到内容补充的处理顺序,让收录结构的变化能持续对比。

网站收录

列表页收了一堆,详情页却没几个:收录核对先看层级之间的配比

做收录核对时,最容易看错的指标是“总收录量”。几十万条 URL 进了索引,看着很健康,但把地址按模板拆开一看,绝大部分是列表页、分页、标签聚合页,真正承载内容的详情页只占很小一部分。这种结构下,站点表面上收录充足,实际能被搜到的有效页面并不多。

先看清收录里的页面都是哪一类

在动手改之前,先把索引里的地址拉出来,按模板归类。不要只看“收录了多少条”,而要看“每一类各占多少”。

分组时至少要把这几类分开

  • 内容详情页:文章、商品、问答等单条内容
  • 列表页:栏目首页、分类页
  • 分页:列表的第 2、3、N 页
  • 标签与聚合页:由筛选、标签、作者等维度自动生成
  • 功能页:搜索结果地址、排序参数页

分组后分别算两个数:这类 URL 一共有多少、其中进了索引的有多少。两个数一对比,问题通常立刻显形——要么是详情页整体收录偏低,要么是聚合类地址把总量撑了起来。

列表页为什么容易被大量收录

列表页有几个天然优势:入口多、更新频繁、被蜘蛛反复访问,而且往往挂在导航和面包屑里,从首页几步就能到。详情页则相反,入口依赖列表页,越靠后的内容越难被走到。当列表分页很深时,详情页的链接会被压到很后面,抓取优先级自然靠后。

详情页收不进去,常见卡点

  • 入口太浅或太深。只有翻到列表第 N 页才出现链接,等于没有稳定入口。
  • 被规则拦住。robots、noindex、canonical 指向别处,任何一条都会让页面出局。
  • 内容与列表摘要重合。详情页正文和列表页里的摘要几乎一样,搜索引擎没有理由单独保留它。
  • 详情页彼此相似。同模板批量生成、只换少量字段的页面,容易被判为重复。
  • 返回状态不对。空内容返回 200,或者未登录就跳登录页,都会影响判断。

处理顺序:先通路,再内容,最后收敛

  1. 确认详情页至少有一个固定入口,不依赖翻页。可以在栏目首页、相关推荐或站点地图里给出稳定链接。
  2. 逐个排查拦截规则,把误拦的放开,把确实不想收的明确标注。
  3. 补足详情页的独立信息,让它比列表摘要多出可读的实际内容,而不是模板字段的堆砌。
  4. 判断聚合类地址的去留。分页、筛选参数这类页面,如果不带来独有信息,考虑收敛入口或做规范化处理。
  5. 改完等一段时间再对比同一组数据,不要当天就下结论。

留一份能持续对比的基线

把分组方式、统计日期、每类 URL 的总数和收录数记下来,隔一到两周用同样的口径再算一次。比值的变化比绝对数字更有参考价值:详情页占比在上升,说明方向对了;只是总量在涨而结构没变,多半还是聚合页在扩。

收录核对看的是结构,不是总数。总量涨得快不等于有效页面变多,先把每一类的占比算清楚,再决定要动哪里。