很多站点在翻看蜘蛛日志时会有一种直观感受:蜘蛛来得不少,但抓来抓去总是那几个页面,真正想让搜索引擎看到的 URL 反而迟迟没有动静。这背后通常不是蜘蛛在针对谁,而是抓取配额的分配问题。
蜘蛛的访问次数不是无限的
搜索引擎不会给某个站点一个公开的、固定的抓取次数,但实际行为上,每个站点在一段时间内能获得的请求量是相对稳定的。这个量由站点体量、更新频率、响应速度、历史抓取效果等多方面因素共同影响。理解这一点,比纠结具体数字更有用。
既然是有限的,就意味着存在竞争:同一域名下所有可被抓取的 URL,都在分这一批访问次数。低价值 URL 多被抓一次,高价值 URL 就少了一次机会。
哪些 URL 在悄悄消耗配额
- 参数组合产生的重复列表页,例如排序、筛选互相叠加。
- 返回 200 但内容为空的软 404 页面,蜘蛛走一趟什么也没拿到。
- 层层跳转的重定向链路,每一次跳转都是一次额外请求。
- 体积大、加载慢的页面,抓取一个要占用更长时间。
- 已确认没有收录价值,却被内链反复指向的 URL。
判断标准不是“这个页面重不重要”,而是“它值不值得占用一次请求”。
内链结构决定了先抓谁
蜘蛛没有全站地图,它靠链接一步步走。首页、主导航、栏目列表、面包屑上的链接,天然更容易被反复访问,也更容易被安排重新抓取。藏在深处的页面,如果只有一两条内链指向,往往要等很久。
如果希望某批 URL 被更快发现,先检查它们是否出现在稳定的、靠近首页的内链路径上,而不是只躺在 Sitemap 里等。
Sitemap 提供候选,不决定顺序
Sitemap 的作用是把 URL 清单交给蜘蛛,它解决的是“知不知道存在”,并不解决“什么时候抓”。清单里的 URL 越杂,单个 URL 被安排到的时间可能越靠后。所以 Sitemap 应该保持干净,只放真正希望被收录的规范 URL,而不是把全站所有参数变体都塞进去。
服务器响应速度直接换算成配额
抓取是一个请求对应一个响应进行的。响应慢,蜘蛛在同样时间内能完成的请求数就少;返回 5xx 或者长时间超时,还可能触发更保守的抓取频率。对中小站点来说,把首字节时间控制在一个合理范围内,往往比做很多技巧性优化更实在。
- 检查是否存在慢查询或没有缓存的动态页面。
- 确认 CDN 回源不是瓶颈。
- 尽量避免在蜘蛛访问高峰做大规模发布或重建。
观察与调整的简单做法
- 按目录或路径前缀统计日志,看访问量集中在哪几类 URL 上。
- 列出访问量高但长期没有收录价值的路径,考虑收口或屏蔽。
- 对比调整前后,重点看抓取分布是否变化,而不是总量是否暴涨。
- 对确实重要的新页面,主动构建内链入口,并保持 URL 长期稳定。
几个容易踩的误区
把抓取量下降一律理解成“被惩罚”,通常并不成立。站点内容变少、响应变慢、大量重复 URL 出现,都会让蜘蛛减少访问。反过来,抓取量上升也不等于收录变好——如果上升的是一堆无价值页面,那只是另一种形式的浪费。
配额管理的本质是取舍:让有限的一次抓取,落在真正需要被看到的 URL 上。