抓取统计面板给的是聚合后的概览,有延迟也有采样。当你想弄清楚某个目录是不是根本没被爬、某个 5xx 是不是一直在发生、哪些参数 URL 被反复访问时,服务器日志往往是唯一能给出直接答案的地方。它不依赖第三方口径,站点自己就能留下证据。
日志不会告诉你页面应该怎么改,它只告诉你实际发生了什么。把实际和预期放在一起对照,判断才有依据。
一条日志里值得看的字段
- 请求时间:看抓取的时间分布,判断是否落在站点低峰,也方便和服务器负载曲线对齐。
- 客户端 IP 与反向解析:IP 段和反向 DNS 是核验蜘蛛身份的基础,只看 User-Agent 并不可靠。
- User-Agent:用来区分不同来源的抓取,也用来和 IP 核验结果交叉比对。
- 请求方法与 URL:能看出抓取路径,判断蜘蛛是不是长期在列表页打转。
- 状态码:200、301、404、410、5xx 各自的比例和变化趋势。
- 响应时间与响应字节数:字节数异常偏小,往往意味着空壳页、错误页或渲染不完整。
- Referer:能还原蜘蛛是从哪个链接走到这个 URL 的,对排查内链结构很有用。
日常该盯的几个指标
抓取总量与分布
先看总量有没有突变,再看它分布在哪些目录。如果八成抓取都集中在少数几个列表页,深处页面很难获得机会。反过来,如果某个新上线的目录在日志里几乎不出现,就要检查它是否被内链和 Sitemap 覆盖到。
状态码构成
5xx 的比例最需要盯,尤其是持续多天出现的同一批 URL,通常指向后端超时或资源瓶颈。404、410 集中出现,则要回头检查内链和 Sitemap 里是否残留了过期地址。301 链路过长也值得注意,跳转链条越长,抓取效率损耗越大。
抓取路径与重复访问
看深度分布:是首页到栏目再到详情逐层展开,还是大量 URL 都停留在浅层。同时留意同一 URL 在内容没有变化的情况下被频繁访问,这类重复抓取会占用本可以分给其他页面的额度。
响应时间
把蜘蛛的抓取时段和站点的慢响应时段叠在一起看。如果抓取高峰正好撞上数据库压力最大的时段,蜘蛛拿到超时的概率就会明显上升,这属于服务端问题,不是内容问题。
几个容易误读的地方
- 日志条数多不等于收录多,抓取和收录是两件事。
- 单日波动说明不了趋势,至少看周维度的走向。
- 蜘蛛来得勤,不代表页面会被收录或获得排名。
- UA 字符串可以伪造,核验身份还要看 IP 归属和反向解析结果。
把日志转成可执行的清单
- 设定日志保留周期,至少覆盖一个完整的内容更新周期,便于前后对比。
- 按目录、状态码、来源做分组统计,形成一份固定的周报。
- 把日志里出现的 URL 和 Sitemap、内链清单对照,找出该被爬却没有出现的页面。
- 对反复出现的 5xx 和超时,先修服务端,再谈抓取优化。
- 对参数页和重复 URL 做收敛,减少无意义的抓取消耗。
- 完成调整后再观察一轮日志,比较调整前后的差异,而不是凭感觉判断有效。
一点提醒
日志是观察工具,不是优化捷径。它能帮你定位问题发生在哪一层——连接、服务端、内链还是内容本身,但不能替你决定某个页面是否值得存在。把日志结论落到具体动作上,再回来看数据有没有变化,这个循环比反复刷新统计面板有用得多。