收录量好看,有效页面却没几个
很多站点做收录,盯的是“收录量涨没涨”。但收录量本身不是目标。当索引里堆了大量低价值 URL,会出现一种常见情况:后台看到的索引数字还算体面,真正能带来访问、能承接搜索需求的页面,还是那几十个。这种状态可以笼统称为索引膨胀。
它不一定触发什么明确的惩罚。更常见的影响是隐性的:抓取资源被分散,页面质量信号被稀释,后续做数据分析时分子分母都不干净。所以处理它的意义,更多在于把有限资源集中到值得留的 URL 上。
哪些页面容易变成低价值收录
- 筛选、排序、参数组合页:?sort=、?tag= 这类通常只是同一批内容换了顺序。
- 空白搜索结果页、空分类页,页面结构完整但正文为空。
- 重复的列表分页,尤其是靠后、几乎无人点击的那几页。
- 测试页、临时活动页、已经下线的专题。
- 内容极薄的关键词聚合页,只换了标题里的地名或数字。
- 大量相似的模板页,除了变量之外几乎没有差异。
判断标准可以简单一点:这个 URL 单独打开时,有没有提供别处拿不到的信息或操作?如果答案是没有,它就不太值得继续占索引。
先量化,再动手
不要凭感觉删。可以用站点日志、sitemap、CMS 导出的 URL 列表做交叉比对,统计几组数字:
- 总 URL 数与索引中数量的差距。
- 近 90 天有自然搜索曝光的 URL 占比。
- 有站内链接指向的 URL 占比。
- 模板型和参数型 URL 的数量与占比。
如果曝光高度集中在少数 URL 上,而其余 URL 既没有曝光也缺少内链,基本可以判断存在膨胀。这时候再决定哪些收口,就有依据了。
收口的顺序
- 先处理明确无用的:测试页、下线活动页、空结果页。
- 再处理参数与排序变体,优先用 canonical 收敛,确有必要时再加 noindex。
- 分页页保留有实际价值的,收口深处无点击的部分。
- 最后处理薄内容聚合页,能合并就合并,不能合并再考虑下线。
顺序上从“确定没用”走向“可能有用”,尽量避免误伤。每批改动量控制在可回滚的范围内,观察一段时间再进入下一批。
几个容易踩的地方
noindex 和 robots.txt 别混着用
robots.txt 的作用是阻止抓取,不保证 URL 不进索引——被外链指向的地址仍可能以无摘要形式出现在结果里。要让页面退出索引,用 noindex。两者同时用,反而可能让蜘蛛读不到 noindex 标签。
sitemap 要和收口动作同步
决定收口的 URL,就别继续放在 sitemap 里。一边 noindex 一边照常提交,只会让信号互相打架。
内链别反向暴露
收口的页面如果还被导航、面包屑、正文大量链接指向,抓取和判断都会反复被拉回去。收口页面最好从主要内链结构里撤出,或者至少减少入口。
别一次性清太多
大批量改动之后索引数据波动明显,很难判断是哪一批动作起了作用。分批、留记录、留观察窗口,比一次性清干净更容易复盘。
收口之后看什么
主要看三个方向:核心页面的曝光是否有变化,索引数量是否逐步稳定,抓取是否更多落在有价值的 URL 上。索引数字短期波动是正常的,不建议一天一改。
索引膨胀处理的是“该不该留”的问题,不是“能不能被收录”的问题。先把不用留的 URL 清出去,剩下的页面才有更清晰的抓取与评估环境。