网站收录

收录率算不准,先看分母:哪些 URL 本来就不该参与统计

统计收录率之前,先要确定分母。参数页、站内搜索结果、测试目录、已下架的旧地址如果都算进去,得到的比例无法反映真实情况。本文按 URL 意图分成必须收录、可选收录和应当排除三类,给出剔除干扰项的核对顺序,并说明剔除之后如何按模板定位差异。

网站收录

收录率算不准,先看分母:哪些 URL 本来就不该参与统计

很多站长把“收录率”当作站点健康的体温计,但真正能说明问题的前提是:分母要定得对。如果把参数页、站内搜索结果、测试目录、已下架的旧地址全都算进去,得到的比例既不能反映内容质量,也没法用来指导改版。先把分母定清楚,再去看差在哪。

一、先分清三类 URL 的意图

同一个站点里,URL 并不是生来平等的。按“是否希望它出现在搜索结果里”可以先粗分成三类。

  • 必须收录:有独立主题的详情页、稿件页、商品页、问答页等,用户会直接搜索到它们。
  • 可选收录:栏目页、标签页、分页列表。是否保留取决于它本身有没有独立价值,比如是否有独特的内容摘要与描述。
  • 不该参与统计:站内搜索结果、筛选参数组合、跟踪参数、测试目录、已下架页、后台与接口地址。

这三类的处理方式完全不同。统计收录率时,只有第一类和明确保留的第二类应当进入分母。

二、把不该统计的 URL 先剔出去

常见的干扰项有几类,剔除时按下面的顺序核对,能省下很多解释成本。

  1. 被 robots.txt 屏蔽或带 noindex 的目录,本身就不指望收录。
  2. 跳转链里的旧地址,比如 301 指向新页的旧 URL,属于迁移痕迹。
  3. Sitemap 中已经删除、但抓取日志里仍有记录的 URL。
  4. 带 session、ref、排序、筛选等参数的同义页面。
  5. 已经返回 404 / 410 的历史地址。

三、剔除之后再看差在哪

分母干净了,剩下的差异才有分析价值。此时建议按模板而不是按单个 URL 去看,因为同一模板的页面通常共享同一套问题。

1. 抓取正常但没进索引

先确认页面是否被判定为低价值或重复,再检查 canonical 是否指向了别的地址、正文是否主要靠 JavaScript 渲染。

2. 抓取都很少

这类问题通常不在内容,而在发现路径:内链深度太深、列表页没有把详情页链出去、Sitemap 更新滞后,都会让页面长期停在“已发现”状态。

3. 收录后又被移除

多见于空壳页或内容大量重复的页面。可以对照同一模板中仍然保留索引的样本,看差异集中在正文长度、结构化信息还是模板区域。

收录率不是越高越好,而是“该收录的那部分是否稳定收录”。把不该收录的页面硬塞进统计,只会让数字变好看或变难看,却解决不了真实问题。

四、把分母固定下来,再做长期对比

建议给站点维护一份简单的 URL 分层清单:按目录和模板归档,标出“必须收录”“可选”“排除”三种状态,并让 Sitemap、robots、canonical 三处保持一致。这样每次统计时,分母是可复现的,相邻两次的数据才有可比性。

当分母稳定、样本固定之后,再去看抓取频率、索引状态和页面质量之间的对应关系,会比单纯盯一个百分数有用得多。