很多站长会问:蜘蛛一天到底来访多少次?这个数字没有统一答案,搜索引擎也不会公开。但有一个更实用的思路:把蜘蛛每一次成功抓取都当成一次成本,看它被花在了哪些 URL 上。消耗得越多、回报越低的页面,就越值得收敛。
抓取配额不是一个固定数字
搜索引擎的抓取能力受限于自身基础设施,也受限于你的服务器。它通常会在三类信号之间做平衡:
- 站点容量:服务器响应速度、错误率、是否频繁超时。
- 抓取需求:站点更新频率、Sitemap 与内链暴露出的 URL 数量。
- 页面价值:外链、历史点击、内容是否长期不变。
所以“配额”不是每天固定发多少张票,而是一个动态结果。服务器越稳、反馈越明确,蜘蛛越愿意多来;如果它总是撞上超时和重复内容,来一趟的意愿就会下降。
配额容易被吃掉的几类 URL
参数与排序副本
筛选、排序、追踪参数会生成大量内容相近的页面。蜘蛛顺着链接一路抓下去,可能把大部分访问用在几乎相同的列表上。处理时可以优先保留一到两种参数组合,其余用 canonical 或 robots 规则收敛。
会话语义和临时链接
URL 里带会话 ID、时间戳、随机 token,会让蜘蛛每次都当成新页面。这类链接应尽量不写进正文内链,也不要交给 Sitemap。
状态码混乱的页面
空结果页返回 200、下架商品返回 200、错误页也返回 200,都会让蜘蛛反复回访同一批无价值 URL。这类页面该 404 就 404,该 410 就 410,不要用 200 掩盖。
深分页与归档
翻到几十页以后的列表,单页价值低但数量巨大。可以限制可翻页范围,归档页只保留按时间聚合的入口,减少蜘蛛在尾部停留。
自查:从日志里看配额去了哪
把最近一周的日志按目录或 URL 前缀聚合,重点看三个数:
- 每个目录被抓取的总次数,以及其中返回 200 的比例。
- 响应时间的分布,慢的目录往往会让蜘蛛提前收手。
- 被抓取最多的 URL 是否包含你并不关心的参数页或空结果页。
如果某一类 URL 抓取量很大、内容却几乎不变,基本可以判定是配额浪费点。
抓取量下降时,先别急着加外链,先确认蜘蛛是不是把访问次数花在了重复和无效的页面上。
把配额引导到关键 URL 的几个动作
- 内链指向规范页:正文里只链主版本 URL,不要同时给出带参数的副本。
- Sitemap 只放主 URL:把希望被抓的页面写清楚,不要把所有参数组合都塞进去。
- 加快首字节响应:减少重定向链、避免同步外部请求,让重要目录稳定在合理耗时内。
- 更新即暴露:新内容发布后,从首页或栏目页给它一个可点击入口,比只放 Sitemap 更容易被走到。
- 区分该抓和不该抓:该抓的保证可访问、可渲染;不该抓的用明确规则挡住,而不是靠运气。
用一段时间观察,而不是一天
抓取行为有波动,单日数据说明不了太多。调整规则后,观察两到四周的抓取分布是否变化:重要目录的 200 抓取是否上升,参数页是否下降,错误率是否收敛。只要方向对,就继续;没变化,再回到日志里找原因。
配额管理的目标不是让蜘蛛来得更勤,而是让每一次来访都落在会变化、有价值的 URL 上。