站点的索引数量在涨,自然搜索访问却没有跟着变,甚至略有下滑,这是很多运营者都会遇到的情况。数量本身不说明问题,多出来的是什么类型的页面才说明问题。在动手清理之前,先把索引里的 URL 归一次类,再决定动谁、按什么顺序动。
第一步:把“多出来的”归类,而不是先下结论
从索引数据或站点地图的对比里抽样 50 到 100 条新出现的 URL,看它们的路径和参数特征。常见的几类大致是:
- 站内搜索结果页,比如 search 或 q 参数;
- 筛选、排序、视图切换参数组合出来的页面;
- 标签页、作者页、日期归档这类聚合入口;
- 列表分页的深层页面;
- 同一内容的不同 URL 版本:协议、大小写、结尾斜杠、参数顺序不一致;
- 测试目录、废弃页面、带会话标识的链接。
先只统计类型和占比,不解释原因。占比最高的那一类,往往就是处理收益最大的地方。
处理顺序:影响面大、改动成本低的先做
第一层:本来就不该存在的 URL
测试页、已废弃的目录、带 session 参数的链接、内部搜索结果,这类页面既没有搜索需求,也没有内容价值。如果页面确实要下线,返回 404 或 410 是最干净的做法;如果目录还要保留,用 robots.txt 屏蔽爬取也可以,但要注意别同时给这些页面加 noindex——被 robots 屏蔽之后,爬虫读不到 noindex 指令。
第二层:同一内容的多个 URL 版本
先统一访问规则:协议、域名前缀、大小写、结尾斜杠、参数顺序,只保留一个可访问版本,其余做 301。这一步不直接解决收录数量,但能避免同一篇内容分散成多个索引条目,也方便后面统计。
第三层:参数页与分页
筛选组合页里,通常只有少数几种组合真的有人搜。可以保留这部分,其余用 canonical 指向主列表页,或者用 noindex,follow 保留链接传递。分页则常见做法是只让第一页进入索引,翻页页面不索引但保持可抓取,让爬虫能顺着走到更深的条目。
第四层:模板化、内容单薄的页面
内容少、段落重复、缺少主内容的页面,问题不在索引指令,而在页面本身。要么补足内容让它值得被搜到,要么和相近页面合并。合并之前先确认这个 URL 有没有外部链接和真实访问,别把有用的入口一起关掉。
判断“该不该被索引”的三个问题
- 它有没有独立价值?和站内其他页面高度重复,用户进来看到的都是同样的东西,倾向不索引。
- 会不会有人搜到它?没有对应的搜索需求,收录了也基本不会有访问。
- 进来的人满不满意?内容不完整、信息过时,即使能排上去,停留和回退数据也不会好看。
三个问题都答不上来的页面,处理优先级可以往后排;三个都不满足的,基本可以进入清理名单。
动作做完,怎么核对
指令类的改动(noindex、canonical、屏蔽)需要时间生效,别指望第二天就看到索引数下降。可以先用 URL 检查工具确认爬虫拿到的指令是预期的那一条,然后按 2 到 4 周的节奏观察索引数量和结构变化。
改的时候建议分批,留一部分页面作为对照。一次性把整个目录处理掉,之后出现波动就分不清是改动生效还是别的原因。
收录数量本身不是目标。能被搜到、并且带来有效访问的页面有多少,才是更值得盯的数字。
几个常见误区
- 想用 robots.txt 屏蔽某个页面,却又指望它不再出现在索引里——屏蔽爬取和从索引移除不是一回事。
- 为了压收录数量,把整个目录整块屏蔽,连带把有用的页面一起挡掉。
- 只看索引总数,不看目录和页面类型的结构变化,结果数字降了但问题页还在。
索引数量的变化,多数时候是页面结构问题的结果,而不是原因。把 URL 按类型拆开,先处理成本最低、影响最明确的那一层,剩下的再慢慢看。