很多站长把“收录率”当作站点健康的体温计,但真正能说明问题的前提是:分母要定得对。如果把参数页、站内搜索结果、测试目录、已下架的旧地址全都算进去,得到的比例既不能反映内容质量,也没法用来指导改版。先把分母定清楚,再去看差在哪。
一、先分清三类 URL 的意图
同一个站点里,URL 并不是生来平等的。按“是否希望它出现在搜索结果里”可以先粗分成三类。
- 必须收录:有独立主题的详情页、稿件页、商品页、问答页等,用户会直接搜索到它们。
- 可选收录:栏目页、标签页、分页列表。是否保留取决于它本身有没有独立价值,比如是否有独特的内容摘要与描述。
- 不该参与统计:站内搜索结果、筛选参数组合、跟踪参数、测试目录、已下架页、后台与接口地址。
这三类的处理方式完全不同。统计收录率时,只有第一类和明确保留的第二类应当进入分母。
二、把不该统计的 URL 先剔出去
常见的干扰项有几类,剔除时按下面的顺序核对,能省下很多解释成本。
- 被 robots.txt 屏蔽或带 noindex 的目录,本身就不指望收录。
- 跳转链里的旧地址,比如 301 指向新页的旧 URL,属于迁移痕迹。
- Sitemap 中已经删除、但抓取日志里仍有记录的 URL。
- 带 session、ref、排序、筛选等参数的同义页面。
- 已经返回 404 / 410 的历史地址。
三、剔除之后再看差在哪
分母干净了,剩下的差异才有分析价值。此时建议按模板而不是按单个 URL 去看,因为同一模板的页面通常共享同一套问题。
1. 抓取正常但没进索引
先确认页面是否被判定为低价值或重复,再检查 canonical 是否指向了别的地址、正文是否主要靠 JavaScript 渲染。
2. 抓取都很少
这类问题通常不在内容,而在发现路径:内链深度太深、列表页没有把详情页链出去、Sitemap 更新滞后,都会让页面长期停在“已发现”状态。
3. 收录后又被移除
多见于空壳页或内容大量重复的页面。可以对照同一模板中仍然保留索引的样本,看差异集中在正文长度、结构化信息还是模板区域。
收录率不是越高越好,而是“该收录的那部分是否稳定收录”。把不该收录的页面硬塞进统计,只会让数字变好看或变难看,却解决不了真实问题。
四、把分母固定下来,再做长期对比
建议给站点维护一份简单的 URL 分层清单:按目录和模板归档,标出“必须收录”“可选”“排除”三种状态,并让 Sitemap、robots、canonical 三处保持一致。这样每次统计时,分母是可复现的,相邻两次的数据才有可比性。
当分母稳定、样本固定之后,再去看抓取频率、索引状态和页面质量之间的对应关系,会比单纯盯一个百分数有用得多。