抓取配额不是官方术语,约束却是真实的
搜索引擎并没有公开一份“每个站点每天能抓多少页”的清单,但爬虫在单位时间里能处理的 URL 数量确实有上限。这个上限与服务器响应速度、站点历史表现、页面总量都有关系。可以把它想成一条带宽:同一时间窗口里,爬虫只走得完其中一部分地址。被走到的页面才有机会进入后续的索引流程,走不到的只能继续排队。
所以“收录慢”有时不是内容质量问题,而是访问次数被别的东西占住了。
哪些 URL 在悄悄占掉访问次数
多数站点的问题不是抓得太少,而是抓的东西和想收录的东西对不上。以下类型常年消耗访问量,却很少带来实际价值:
- 筛选、排序、追踪参数:颜色、价格区间、排序方式组合出的 URL 数量,可以轻松超过正文页数倍。它们内容高度相似,实际收录价值很低。
- 无限滚动与日历控件:日历常常能翻到多年前的日期,每一个日期都可能生成一条可访问地址。
- 站内搜索结果页:参数化的搜索页会被反复抓取,尤其是被内链或外链引用过之后。
- 重定向链:一次 301 跳到另一次 301,每次跳转都是一次请求,链越长浪费越多。
- 软 404 与空壳页:返回 200 但正文近乎为空,抓取后不会产生有效索引,却占用了本次访问机会。
先测量,再决定砍哪里
凭感觉屏蔽目录容易误伤真正有价值的页面。更稳的做法是从服务器日志里取一段连续时间的数据,再和实际想收录的页面清单对照。
三个可以直接对比的口径
- 按目录统计请求量:看哪些路径吃掉了最多请求,正文目录是否排在前面。
- 按状态码统计:200、301、304、404、5xx 各占多少。重定向和 5xx 比例偏高,通常说明存在浪费。
- 按响应耗时排序:慢页面会拖住整体节奏,一个响应要好几秒的接口页,可能比几十个静态页更费预算。
把这三组数字摆在一起,差距一般就很清楚了:如果参数页的抓取次数远超正文页,说明入口没有被收住。
把访问量还给正文页
调整的方向不是“越多越好”,而是让爬虫优先走到有内容的地址:
- 参数页用 robots.txt 屏蔽抓取,或阻止其进入索引流程;这两者作用并不相同,需要分开判断。
- 把多级跳转合并成一次,旧链接直接指向最终地址,减少中间请求。
- 让重要正文页尽量靠近首页,减少需要多次点击才能到达的深度。
- 站点地图只列出希望被收录的规范 URL,不要把筛选页、搜索页一并放进去。
- 定期清理已失效但仍被内链指向的地址,避免它们反复触发 404。
放慢抓取,代价可能比你想的大
服务器压力大的时候,有人会直接限制爬虫速度,或长时间返回 429、503。这样做短期能缓解负载,但抓取频率一旦被下调,恢复通常需要一段时间。更稳妥的顺序是:先减少无价值 URL 的暴露面,再考虑是否需要限速。页面响应变快本身,就会让单位时间内的有效抓取量上升。
抓取次数不会因为催促而变多,却会因为站内越来越干净,而分到更该去的地方。
持续观察比一次性优化更重要
站点结构会变,新栏目上线、旧活动页下线,都会改变 URL 的分布。建议每隔一段时间重新跑一次日志统计,对比正文页与参数页的抓取比例。如果正文页的占比在上升,方向基本是对的;如果参数页仍在增长,说明还有入口没有收住。
需要提醒的是,抓取正常不等于一定被收录。抓取只是把页面取回去看,是否进入索引还要看内容质量、重复程度和查询匹配。把访问量集中在有内容的页面上,能提高的是被判断的机会,而不是结果本身。