搜索抓取

URL 发现的日常巡检:把发现与抓取指标放进周报

URL 发现不是一个一次性动作,而是从链接曝光到进入抓取队列的持续过程。本文整理了几项值得定期记录的指标,包括 Sitemap 抓取频次、新增地址数、状态码分布与抓取深度,并说明如何用服务器日志交叉验证,以及在指标异常时按什么顺序排查。

搜索抓取

URL 发现的日常巡检:把发现与抓取指标放进周报

URL 发现问题通常不是“有没有被收录”这么单一,而是持续发生的状态:链接有没有被看到、看到之后有没有进入抓取队列、抓取是否成功。这些环节分散在搜索平台后台、服务器日志和站点结构里,只看一个数字容易误判。把几项指标固定下来,按周或按双周观察趋势,比临时排查更省力。

先分清“已发现”和“已抓取”

发现和抓取是两个阶段。地址被发现只代表进入了候选队列,抓取还要等调度。后台里“已发现但未抓取”的数量上升,可能意味着站点新增地址太快,也可能意味着服务器响应拖慢了队列消化;而“已抓取”数量稳定但收录变化不大,则要回头看内容质量与重复度,而不是继续加链接。

把这两个数字分开记录,能避免把调度问题当成内容问题处理。

值得放进周报的几组指标

  • Sitemap 抓取频次:索引文件和分片文件被请求的次数、返回状态码。如果频次骤降,先确认文件本身能正常访问。
  • 新增 URL 数量:本周新增的可访问地址,与上周对比,增长是否与运营动作匹配。
  • 抓取请求总量与状态码分布:2xx、3xx、4xx、5xx 各占多少。5xx 比例升高时,抓取队列会被反复占用。
  • 平均响应时间:按目录或模板分组看,比全站平均值更有用。
  • 抓取深度分布:被请求的地址里,距离首页三跳以内的占比。
  • 失效地址数量:404、软 404、410 的增减,反映清理是否及时。

这些指标不需要精确到个位数,重点是趋势。建立了三四轮的基线之后,偏离基线往往比绝对数值更有提示意义。

用服务器日志做交叉验证

后台数据有延迟和抽样,服务器日志更接近原始记录。看日志时至少保留时间、请求路径、状态码、响应时间、User-Agent 和来源 IP 几个字段,便于按 UA 过滤搜索蜘蛛,再和后台数字对照。

有两个容易踩的坑:一是站点用了 CDN 或反向代理,日志里的 IP 不是真实访客,UA 也可能被改写或缓存;二是把真实用户和其他爬虫混进统计。先确认日志采集链路,再谈分析。

指标异常时的排查顺序

  1. 确认 robots.txt 没有误挡新增目录,同时检查文件是否可正常读取。
  2. 检查 DNS 解析、HTTPS 证书和 CDN 回源,排除连接层问题。
  3. 查看 5xx 与超时的集中时段,是否与发布、压测或流量高峰重合。
  4. 核对内链结构是否变化,比如导航改版后深层页面是否失去入口。
  5. 确认 Sitemap 是否仍被引用,分片文件有没有遗漏或重复。

多数“发现变慢”的问题落在这几步里,很少需要一上来就大改结构。

巡检节奏与记录方式

建议固定一个节奏,例如每周记录一次抓取请求总量、状态码分布和新增地址数,每月核对一次抓取深度与失效地址。记录时标注当周的上线动作,后续回看才找得到原因。

指标是用来发现异常的,不是用来追求绝对增长的。抓取量短期波动很正常,连续两三周偏离基线才值得深入排查。

URL 发现和抓取是长期过程,指标的价值在于把“感觉变慢了”变成可以复核的记录。把观察、对比、排查串成固定动作,站点运营会稳定很多。