做收录核对时,很多人只盯着收录变少,其实收录量突然上涨同样需要核对。索引条数增加不等于站点变强,它可能只是同一批内容换了几种地址、几种参数、几种排序方式,各自占了一个位置。先分清新增的是有效页面还是重复膨胀,再决定动不动手。
索引量上涨通常有两种来源
一种是正常增长:新栏目、新详情页、新文章被正常发现并入库,这些 URL 有自己的标题、正文和搜索需求。另一种是膨胀:同一份内容以不同地址被收录,比如筛选参数、排序参数、分页的每一页、会话 ID、打印页、被转载的镜像页,以及内容极少但数量巨大的标签页和聚合页。
两者的处理方向完全相反:前者要做的是保持抓取顺畅、补内链入口;后者要做的是归并或挡住。搞混了,容易把正常页面一起挡掉,也容易把占位页面当成资产继续留着。
第一步:把新增 URL 按模式聚类
不要逐个看 URL,先按模式分组,看每一组贡献了多少条。常用做法是从站点地图、抓取日志和索引抽样三处取 URL,按路径规则归类,再算每组的数量占比。
- 路径里带 问号参数 的:排序、筛选、跟踪、会话,分开统计。
- 路径层级很深的:分页、日期归档、日历页。
- 路径很短但数量巨大的:标签、作者、聚合列表。
- 同一正文出现在不同目录的:语言变体、移动端地址、测试环境遗留。
归类之后基本能看出,是某一类模板在批量生产 URL,还是新内容在稳定增长。这一步做扎实,后面的判断才有依据。
第二步:判断这组 URL 有没有独立价值
判断标准不是能不能打开,而是打开之后和别人有什么不同。可以按下面几条逐项过一遍:
- 标题和描述能不能独立成句,还是只写了某列表第几页。
- 正文主体与原页面是否重复,重复的部分大概占多少。
- 这组 URL 有没有自己的搜索需求或外部链接指向。
- 如果没有它,用户能不能从主页面正常走到同样的内容。
几条里大多是否定的,基本可以按重复占位处理。反过来,如果它有独立内容、独立流量或独立入口,收缩它反而是在削自己的一条路。
第三步:按顺序处理,别一上来就全站屏蔽
- 先合并内容:能整合到主地址的,用 301 或 canonical 归并,让信号集中到一个地址上。
- 再补规范化:筛选、排序这类参数页面,用 canonical 指回无参数版本,同时在页面上保留可点击的正常入口。
- 再考虑 noindex:确实没有独立价值、又不便跳转的页面,可以加 noindex,注意要允许抓取,否则指令读不到。
- 最后才是 robots.txt:它只挡抓取,不挡索引,对已经收录的页面使用它,往往会长期留下一个空结果。
顺序反了会出现一种常见现象:你挡住了抓取,搜索引擎既收不到 noindex,也无法读到更新后的页面,于是索引里长期保留旧版本,看起来像怎么处理都清不掉。
核对时容易忽略的两点
- 索引量是滞后指标。今天的改动可能几周后才反映到统计里,短期数字反弹不代表处理失败。
- 不同查询口径的数字本来就不一样。站内查询、索引报告、日志统计数出来的量各不相同,核对时固定一种口径,否则会把口径差当成收录波动。
最后提醒一句:清理重复膨胀的目标是让每个被收录的地址都有自己的理由,而不是把数字压到某个标准以下。数量本身说明不了太多,页面结构和内容质量才是判断依据,具体结果也取决于站点实际情况和搜索引擎的处理节奏。