收录问题排查时,后台的收录数字只告诉你结果,不告诉你过程。服务器日志记录的是蜘蛛真实访问过哪些 URL、什么时间访问、拿到了什么响应。页面迟迟进不了索引,日志通常比报表更早给出线索。
第一步:把三类请求分开
日志原始内容很杂,直接看容易误判,先按 User-Agent 分层:
- 搜索引擎蜘蛛:百度、Google、Bing 等,标识明确,是分析主体。
- 正常用户访问:包括浏览器预取和静态资源请求,占比通常很大。
- 其他爬虫:采集器、监控工具、SEO 工具,与收录没有直接关系。
拆完之后,剩下要分析的数据量会小很多,也更容易看出规律。
第二步:看抓取频次和投放位置
频次不是越高越好,重点是分布是否合理。如果蜘蛛每天来几百次,但绝大多数落在首页、列表页和几个参数地址上,说明内链没有把路径带到深层页面。
频次突然下降,一般先查这几项:
- 服务器响应变慢或频繁超时;
- 近期新增了大量低质或重复页面,拉低了整体质量判断;
- robots.txt 或页面指令被改动,挡住了抓取;
- 站点结构大改,旧入口返回 404,蜘蛛找不到落点。
反过来,频次正常但收录不动,问题通常不在抓取环节,而在页面本身。
第三步:看蜘蛛走过的路径
把日志里的 URL 按目录归类,可以直观看到蜘蛛的兴趣点:
- 请求集中在几个模板页,说明其他模板缺少入口;
- 大量参数型 URL 被抓,说明筛选、排序、追踪参数没有做好规范化;
- 出现大量 404 和跳转链,说明历史链接没有清理干净。
这一步常能定位到“蜘蛛知道 URL 却没有继续往下走”的具体位置。
第四步:看响应状态和耗时
状态码在日志里是分层的,每一类指向的原因不同:
- 频繁 5xx:服务器或后端不稳定,蜘蛛会主动降低抓取频率;
- 大量 404:可能是内链写错,或者页面已删但链接还在;
- 跳转链过长:每次跳转都会消耗抓取额度;
- 耗时明显偏高的 URL:容易被中断,抓取不完整。
响应时间是常被忽略的一项。同样一批页面,如果平均响应从几百毫秒变成几秒,抓取量下降几乎必然发生。
日志不能回答的部分
日志能证明“蜘蛛来过”,不能证明“页面被收录”。抓取和收录之间还隔着内容质量、重复程度、URL 规范等判断。日志里抓取正常、索引里却没有,就要回到页面层面去看:
抓取是蜘蛛的动作,收录是搜索引擎的判断,两者的证据来源不同,不要用一个指标替代另一个。
一份可执行的日志检查清单
- 按 User-Agent 过滤出真实蜘蛛请求;
- 统计每日抓取量,看趋势是否平稳;
- 按目录聚合 URL,看覆盖是否完整;
- 统计状态码分布,重点看 5xx 与 404 的占比;
- 统计平均响应时间,找出明显偏慢的地址;
- 挑出被反复抓取却始终未收录的 URL,单独检查内容与规范。
发现问题后怎么处理
- 响应慢:先解决服务器和数据库瓶颈,其他调整放在后面;
- 抓取集中:补充合理内链,把入口铺到缺少链接的模板;
- 参数泛滥:用规范标签或抓取规则收敛;
- 404 与跳转链:清理内链,把跳转控制在一次以内;
- 反复抓取不收录:从内容重复度、页面价值和 URL 版本统一入手。
日志的价值,在于把“收录不好”这句模糊判断,拆成具体的时间、地址和响应。落到具体 URL 上,处理起来才有方向。