看收录报表时,数字涨跌很容易吸引注意力,但真正影响站点健康的是另一件事:这些被索引的 URL 里,有多少是能承接搜索需求的页面。收录量是结果,不是目标。先给索引页面做一次质量分层,后面的取舍才有依据。
先分三档:能用、备用、该清掉
不必做复杂的评分模型,按用途粗分三档就够用。
- 能用:有独立搜索需求,内容基本唯一,有正常内链入口,用户点进来能得到答案。
- 备用:暂时没有明显搜索表现,但有保留价值,比如刚上线的内容、季节性页面、待补充的长尾页。
- 该清掉:重复、空壳、参数拼接、站内搜索或筛选产生的低价值 URL,长期没有访问也没有内链价值。
分层的意义在于,把“要不要处理”变成“先处理哪一档”。大部分站点的问题不是收录太多,而是该清的那一档长期没人管。
判断页面质量时看哪几个点
先看内容本身,再看抓取和索引条件,顺序不要颠倒。
- 页面是否有明确的搜索意图对应,标题和正文是否在回答同一个问题。
- 正文是否与站内其他页面高度重合,重合部分是否只是模板或参数差异。
- 页面是否有站内入口,还是只能靠 sitemap 或外链被发现。
- 返回状态是否稳定,是否存在跳转链、超时或软 404。
- 页面上是否有下一步路径,比如相关推荐、分类入口或转化按钮。
这几项里只要有一项明显异常,就先记为待观察,不要立刻下结论。
重复内容要先归因,再决定动作
重复不是一种情况。模板重复、参数重复和正文重复的处理方式完全不同。
- 模板重复:多个 URL 只有标题或筛选条件不同,正文主体一致。优先合并或规范 URL。
- 参数重复:同一内容被排序、分页、追踪参数拆成多个地址。先统一参数规则,再处理已索引的残留。
- 正文重复:不同页面写了相同内容,通常来自采集或复制。需要判断保留哪一版,其余做跳转或移除。
归因清楚之前,直接批量删除容易误伤。建议先抽一批样本,确认重复来源集中在哪个模板。
从报表到动作的先后顺序
- 拉一份索引页面样本,按模板或目录归类,不要逐条看。
- 标出每类的内链入口数量、抓取状态和近期搜索表现。
- 把长期无访问、无内链、内容重复的页面放进待处理清单。
- 分小批处理,每批只动一个模板或一类参数。
- 处理完观察抓取和索引变化,再决定是否继续下一批。
这个顺序的核心是控制变量。一次改太多,后面很难判断是哪一步起了作用。
该清掉的页面怎么收尾
不同情况对应不同手段,目标是让搜索引擎和用户都不要把时间花在这些 URL 上。
- 内容还有价值但地址重复:保留一个规范地址,其余用 canonical 指向它。
- 内容已被合并:旧地址做 301 跳转到新地址,并更新内链。
- 内容不再需要:返回 410 或 404,同时从 sitemap 和内链中移除。
- 页面必须保留但不希望被索引:加 noindex,并确认没有被 robots.txt 挡住抓取。
提醒一句:清理动作不要和改版、换模板、调参数同时进行。索引变化需要时间,多个变量叠在一起,报表会失去参考价值。
分层之后,收录量才有意义
把索引页面分成能用、备用和该清掉三类后,收录量就从一个孤立数字变成了结构信息。接下来每次看报表,重点不再是涨了多少,而是能用那一档有没有增加,该清掉那一档有没有减少。这个视角比单纯追求收录数字更接近站点运营的实际问题。