收录数量从来不是一条直线。正常运营的站点,索引量日常上下浮动几十上百条都很常见,幅度小、过几天自己能回弹的波动,通常不需要专门处理。真正值得动手的,是持续下降,或者掉了之后长期不回来。在打开代码之前,先把问题分到“抓取端”还是“索引端”,后面的判断会省很多力气。
先确认是不是真的掉了
报告里的数字和实际收录之间,往往隔着几层误差。动手排查前,先做几个基础确认:
- 报告的更新本身有滞后,昨天的数据可能只反映几天前的状态;
- 同一份数据在不同工具、不同视图下的口径不一样,先确认自己看的是同一个指标;
- 抽样查询的结果波动很大,抽十个词全都没了,不代表整站被清空;
- 确认掉的到底是全站,还是某个目录、某种模板。
如果连续一两周都在下降,并且抽样结果、服务器日志、索引报告三者的方向一致,那基本可以当成真问题来处理。
抓取端:爬虫来得少了
收录的前提是抓取。如果日志里爬虫的访问量明显减少,先看这几处。
服务器与响应
5xx 集中出现、响应时间明显变长,或者防火墙把爬虫当成攻击拦掉,都会让爬虫主动降低访问频率。这类问题往往先影响抓取,再过一段时间才反映到收录上,所以看到收录掉的时候,日志里的异常可能已经发生好几天了。
robots.txt 与页面级指令
robots.txt 的一次改动、模板里误加的 noindex,都可能让一批页面被挡在外面。这类改动容易被忽略,因为页面本身看起来完全正常,用户和爬虫之外的检测工具都看不出异常。
抓取预算被占用
站内搜索结果页、筛选参数的各种组合、日历类无限翻页,会持续消耗抓取量。当这些 URL 的数量膨胀到一定程度,重要页面被访问的频率就会明显下降,表现为“收录没被删,但新内容迟迟进不去”。
索引端:抓到了却没留下
如果抓取量正常,页面也返回 200,但索引量在掉,问题多半出在质量判断上。
内容重复与价值稀释
多城市页、规格页、分页列表,如果主体内容高度相似,搜索引擎会自己挑一个版本留下,其余的退出索引。这类减少不一定是坏事,关键是确认留下的那个版本是不是你想留的。
URL 规范发生变动
改版换了目录结构、统一了大小写或结尾斜杠,旧 URL 没有正确指向新地址,就会出现旧地址已经退出、新地址还没进来的空档期。这个阶段收录下降属于正常过程,重点看新地址有没有被逐步抓取。
模板或结构大改
正文被折叠、主要内容改成 JavaScript 渲染、内链大面积取消,都会让原本表现稳定的页面变得难以判断,进而被移出索引。
一个可以照着走的排查顺序
- 核对指标口径,确认下降趋势到底持续了多久;
- 拉一段时间日志,看爬虫访问量和响应码的变化;
- 对比下降前后的模板、robots.txt、跳转规则有没有被动过;
- 抽样下降最明显的页面,看它们是否属于同一类模板;
- 检查这些页面是否存在重复内容,canonical 指向是否合理;
- 确认清楚之后再动手,一次只改一处,留出观察周期。
收录量下降是结果,不是原因。在没弄清是哪一类页面、哪个环节出问题之前,批量提交、批量改 canonical、批量加内链,很可能把原来的问题盖住,反而更难定位。
收录波动本身不值得紧张,值得紧张的是不知道为什么波动。把抓取和索引分开看,把模板和 URL 分类看,多数下降都能找到对应的入口,也能判断出哪些只需要等待,哪些必须马上处理。