很多站点运营者看日志时,看到 Googlebot、Bingbot、Baiduspider 这类 UA,就默认搜索蜘蛛来了,然后拿这些请求判断收录为什么不动。但 UA 只是一串客户端自报的字符串,任何人都可以伪装。把伪装流量当成搜索蜘蛛,后面关于抓取和收录的判断都可能跑偏。
为什么不能只看 UA
UA 没有强制校验机制。普通脚本、采集器、监控工具都可以把 UA 改成搜索引擎蜘蛛。单看 UA,很容易把噪音当成抓取信号,进而误判站点被频繁访问。
验证来源的几个常用办法
- 反向 DNS 查询:部分搜索引擎蜘蛛会声明来源域名,可以先反查,再正向解析确认是否匹配。
- IP 归属:搜索蜘蛛通常来自官方公布的 IP 段,可用官方文件或 whois 核对,而不是只看 UA。
- 请求频率和路径:真实蜘蛛通常有相对规律的抓取节奏,会访问站内链接和部分静态资源,路径相对分散。
- 是否遵守 robots.txt:这只能作为辅助线索,不能单独用来判断真假。
- 是否加载 CSS、JS:部分搜索引擎会抓取渲染所需资源,但并非所有资源都会请求,不能一刀切。
伪装流量的常见特征
- UA 写得很像,但 IP 段不属于任何搜索引擎官方范围。
- 只抓特定页面,比如搜索页、接口、商品详情,不抓首页和内链。
- 请求间隔要么极快,要么完全无规律。
- 不遵守 robots.txt,或者大量请求带参数的 URL。
- 同一 IP 短时间集中请求,没有 referer,或 referer 固定不变。
真蜘蛛的抓取行为不等于收录
即便确认是真蜘蛛,抓取也只代表“来过”,不代表页面会被索引。索引还要看内容质量、重复情况、URL 规范、站点整体可信度等。日志只能回答“谁来过、抓了什么”,不能直接回答“为什么没收录”。可以把日志和 Search Console 的抓取统计、索引覆盖报告对照,看抓取量、抓取路径和索引状态是否一致。
怎么整理日志避免误判
- 先过滤静态资源和明显噪音,但不要直接删掉所有非 HTML 请求。
- 按 UA、IP、反向解析结果分组,统计各组的请求量。
- 挑几个可疑 IP 做反查,确认是不是官方蜘蛛。
- 把确认的真实蜘蛛请求单独导出,看它们抓了哪些 URL、频次如何。
- 对未被抓取的 URL,再回到内链、sitemap、入口页找原因。
和收录排查怎么衔接
如果日志里大部分“蜘蛛”都是假的,那之前基于日志得出的“蜘蛛很勤快”结论就不成立,需要重新看真实抓取。如果真实蜘蛛确实抓了,但页面没进索引,重点转到页面质量和 URL 规范。反过来,如果真实蜘蛛很少来,先查站点可访问性、robots.txt、内链入口和 sitemap 是否正常。不要用一份没清洗过的日志去下结论。
日志能告诉你谁来过,但不能直接告诉你为什么没收录。先把真假抓取分开,再谈索引。
站点运营里,蜘蛛池、提交工具、外链入口都可能带来访问,但日志里出现的“蜘蛛”需要先验证。把来源、行为、频次三件事对齐,再决定下一步是查抓取还是查索引。