后台报表看不到的东西,日志里往往有
大多数站点能看到的抓取信息,来自搜索平台的站长后台或抓取统计。这些数据经过聚合,优点是直观,缺点是有延迟、有采样、通常只覆盖单一搜索引擎。服务器访问日志是原始记录:谁在什么时间、请求了哪个地址、服务器回了什么状态码、花了多久。排查抓取问题时,先看日志通常比反复刷新后台更快定位到原因。
一条访问日志里值得关注的字段
常见格式大致包含:来源 IP、时间、请求方法与路径、状态码、响应字节数、User-Agent、Referer。多数服务器还会额外记录上游处理时间。对应到抓取分析:
- 时间:抓取是否集中在某个时段,是否和站点维护窗口重叠。
- 路径:蜘蛛实际走了哪些 URL,哪些目录被反复请求。
- 状态码:5xx 集中出现,通常意味着源站或后端不稳。
- 响应时间:长尾慢请求会拖慢整轮抓取。
- 响应字节:状态码 200 但字节数为 0,可能是空响应或中途中断。
先确认来的是不是真蜘蛛
UA 可以随便伪造,判断来源建议按这个顺序来做:
- 用日志里的 IP 做反向 DNS,看域名是否落在官方公布的网段。
- 再做一次正向解析,确认能回到同一个 IP。
- 与搜索平台官方给出的 IP 段列表比对。
验证之后,才能把真实抓取和爬虫软件、镜像站、监控探针区分开。来源没分清,后面的分析结论很容易整体跑偏。
日志里常见的几类抓取异常
抓取量突然下滑
先看是不是服务器侧的问题:某段时间 5xx 或超时上升、带宽打满、WAF 规则变更。抓取量的变化往往滞后于故障本身,日志里能更早看到那个拐点。
状态码结构不对劲
健康站点的抓取日志里,200 应占多数,404 和 301 是少数。如果 404 突然增多,检查是否改过目录结构或参数规则;如果出现 301 长链,把跳转改成直连;如果 5xx 成片出现,优先修后端,而不是继续提交 URL。
URL 分布失衡
把日志路径按目录、参数聚合,看看抓取集中在哪。常见情况是:带一串筛选参数的地址被大量请求,真正需要更新的详情页却很少出现;或者静态资源和接口请求占了很大比例。这类问题通常要靠 robots 规则、参数规范化和内链调整来解决,而不是单纯加大提交量。
响应时间拖尾
关注 P95、P99 这类尾部耗时,而不是平均值。少数慢请求会一直占着连接,让整轮抓取变慢,平均值往往看不出这个问题。
反复抓同一批 URL
如果日志里总是那几个页面在循环,新 URL 迟迟不出现,多半是内链入口太窄:新内容要经过很深的层级才能到达,或者只存在于 Sitemap 里。这种情况先补内链,再谈其他提交方式。
把日志与 Sitemap、内链对照着看
三个数据源互相印证会清楚很多:Sitemap 代表你希望被抓取的集合,内链代表蜘蛛实际能走到的路径,日志代表它真正走了哪些。三者对不上的地方,往往就是抓取效率的损失点。比如 Sitemap 里有、日志长期没有,说明入口不足;日志里有、内链里没有,说明存在历史遗留地址或被外部引用的参数页。
落地时可以先做这几件事
- 日志至少保留 30 天,方便做周与周的对比。
- 按 UA 加 IP 段过滤出真实蜘蛛,单独统计,不和普通访客混在一起。
- 每天汇总一次:抓取总量、状态码分布、访问最多的路径、慢请求清单。
- 出现异常时,按服务器、robots、内链、Sitemap 的顺序依次排查。
日志反映的是抓取过程,不等于收录结果,也不直接决定排名。它最大的价值,是让你在被告知之前,先知道自己这边发生了什么。
把日志当成一份持续更新的抓取记录来看,很多问题就不必等到报表变色才动手。