抓取日志里每条请求都对应一个入口。把入口来源归类,比单纯统计抓取总量更能解释“为什么这个页面一直没被回访”。
入口来源的常见类别
- Sitemap 与索引提交:首次出现时间与提交时间接近,被发现的 URL 往往路径较深。
- 站内链接:从导航、列表、正文链接逐层扩散,抓取顺序呈现由外向内、由浅入深的特征。
- 站外链接:来源分散,回访是否稳定取决于对方页面本身是否被持续抓取。
- 重定向与历史路径:旧 URL、RSS、接口提交、站内搜索页、分页参数都可能成为入口。
日志里的可行性判断
蜘蛛请求大多不带 referer,直接看来源字段往往得不到答案。更可行的做法是用时间与路径序列去推断。
- 先按 UA 与 IP 段过滤出蜘蛛请求,剔除监控、CDN 回源和自检流量。
- 标记每个 URL 的首次抓取时间,与 Sitemap 提交、内链上线、外链发布的时间点做前后比对。
- 看同一批请求的顺序:从列表页连续进入详情页的抓取,多半说明入口来自内链。
- 观察回访间隔。只靠 Sitemap 的页面,回访间隔通常更长,且波动更大。
归类结果的用途
归类不是做报表,而是决定下一步把精力花在哪里。
- 核心页只在 Sitemap 出现、内链路径上从未被抓到,优先补内链,而不是反复提交。
- 深层页只依赖站外入口,回访波动大,考虑在相关栏目中增加稳定入口。
- 同一批 URL 被重复发现(带参数、大小写、结尾斜杠差异),先做入口收敛,再谈抓取频次。
- 入口存在但页面长期不回访,重点检查响应耗时与状态码,而不是继续加链接。
容易出现的误判
- 把蜘蛛池或第三方抓取工具的请求当作搜索引擎蜘蛛,导致入口判断整体偏移。
- 把 CDN 边缘节点的访问记录重复计入,夸大入口数量。
- 把并发抓取误认为多次发现,实际只是同一入口的批量请求。
- 忽略服务器错误与超时,把抓取失败全部归因于入口问题。
入口来源只能说明“可能从哪里被发现”,不能直接推导收录结果。判断仍要回到页面内容、站点结构与整体抓取表现。
落地动作
可以按固定周期做一次核对:导出最近一段时间的蜘蛛日志,按入口类别打标,与内链改动、Sitemap 更新记录对齐,观察两到四周内首次抓取时间与回访间隔的变化。服务器稳定性、响应耗时和返回状态码仍是前提条件,这些指标异常时,入口归类的结论会失真。
把入口来源当作排查工具,而不是优化捷径。清单化执行、定期复盘,比追求单次提交后的即时反馈更可靠。