网站收录

整站收录率只是个平均数:按模板分组看,问题更容易定位

站点收录率是平均值,一个模板出问题常被其他正常页面掩盖。本文讲怎样按页面模板分组统计收录情况,区分模板级问题与单页问题,并给出重复内容、内链过深、URL 变体等常见原因和可执行的排查顺序。

网站收录

整站收录率只是个平均数:按模板分组看,问题更容易定位

做收录检查时,最常见的做法是看一个总比例:站点地图里有多少 URL,索引里有多少 URL。这个数字有参考价值,但它是一个平均数。好模板和坏模板混在一起时,坏的那部分很容易被稀释掉。比如文章详情页九成能收录,商品筛选页只有百分之几,整站算下来还有七八成,看起来“还行”,实际上一整类页面在持续浪费抓取。

先分组,再看比例

比较实用的做法,是按页面模板把 URL 分成几组,每组单独看。分组维度可以包括:URL 路径特征、页面类型、是否带参数、内链层级、首屏是否依赖 JS 渲染。分组之后往往会发现,问题集中在某一两组,而不是均匀分布。

分组后常见的三种结论

  • 整组几乎都不收录:大概率是模板级问题,和单篇内容关系不大。
  • 整组收录忽高忽低:多见于内容量差异大、内链位置不固定的模板,比如标签聚合页。
  • 只有少数页面不收录:更可能是单页问题——内容太薄、与已有页面高度重复,或被某条规则排除。

区分这两类问题很重要,因为处理方式完全不同。模板级问题改一次模板就能覆盖成百上千个 URL,单页问题只能逐页看。

模板级问题,通常是这几类原因

1. 页面之间重复度太高

筛选页、标签页、分页、排序参数页最容易出现这种情况:换个条件,正文几乎没变,标题和描述也是模板套出来的。这类页面会被大量抓取,但进入索引的价值很低。判断方法很简单:随机抽几个 URL,把正文提取出来对比,如果差异只有十几二十个字,基本可以确认。

2. 正文在页面里的占比过低

导航、推荐位、广告、评论区把正文挤到很后面,或者首屏几乎全是模块。抓取工具能拿到 HTML,但很难判断这个页面的主体信息是什么。

3. 抓取入口太深,或者内链太少

先把抓取和收录分开看:翻蜘蛛日志,确认这一类 URL 到底有没有被抓过。没抓过,是发现和调度的问题;抓过多次仍不进索引,才是页面质量或规则的问题。两者的处理方向完全相反。

4. URL 变体没收敛

大小写、尾斜杠、排序参数、追踪参数,都可能让同一个页面裂成多个地址。这些变体会互相分散信号,也让人难以判断哪个是主版本。同一类页面尽量保持一种 URL 形态。

5. 渲染依赖过重

如果正文只有 JS 执行后才出现,而渲染环节又出了问题,抓到的 HTML 就是空壳。判断时可以看抓取工具拿到的原始 HTML 里有没有正文,而不是只看浏览器里的效果。

建议的排查顺序

  1. 按模板分组,算出每组的收录比例,找出异常的那一两组。
  2. 对异常组先查日志:有没有被抓,抓的是哪种 URL 形态。
  3. 抓过但不收,就看页面本身:正文长度、与同类页面的重复度、原始 HTML 里有没有内容。
  4. 再查规则:robots、noindex、canonical 是否在模板层面统一指向了别处。
  5. 改完模板后留出一个观察周期,再看这一组的变化,而不是盯全站总数。
整站收录率适合做趋势观察,不适合用来定位问题。真正有价值的信息,往往藏在某个具体模板的那一组数据里。

一个容易被忽略的点

分组统计不需要很复杂的工具。把站点地图或日志里的 URL 按路径前缀导出,用表格做一次简单归类,就能看出明显差异。关键是养成“按类型看”的习惯,而不是每次都被一个总数带着走。

另外,不是所有低收录的模板都需要救。有些页面的定位本来就是供站内浏览使用,不进入索引并不会带来损失,把它们挡在索引之外反而更干净。分组之后要做的第一件事,是先判断这一组应不应该进索引,再去解决为什么没进。