很多人把收录慢归到“权重不够”,但打开日志往往会看到另一幅画面:蜘蛛确实来了,只是把大部分请求花在了没有收录价值的地方。抓取配额(也常被叫做抓取预算)说的就是这件事——搜索引擎愿意在你的站上投多少抓取请求,以及你的服务器能稳定接住多少。
抓取配额不是开关,而是一种分配
它没有可以查询的固定数值,更像一种动态权衡:搜索引擎根据站点体量、更新频率、响应速度和历史表现,决定用多少资源来抓。站点响应越快、URL 越干净、重复越少,同样的资源就能覆盖更多有效页面。反过来,如果大量请求都落在同一批无价值的 URL 上,真正需要被发现的新页面就排到了后面。
所以下面这些问题,通常不会同时出现,而是先在某几个目录里集中暴露。
常见被浪费掉的几类 URL
- 参数组合页:筛选、排序、会话 id、跟踪参数互相叠加,理论组合几乎无穷。
- 重复入口:同一条内容有带 www / 不带 www、带斜杠 / 不带斜杠、大小写不同的多个版本。
- 失效地址:已经下线但站内还留着链接的旧页面,蜘蛛每次来都要吃一次 404 或软 404。
- 重定向链:A 跳 B、B 跳 C,一次抓取消耗三次请求,中途还可能断掉。
- 无意义分页:日历页、翻到很后面的列表页,几乎没有被访问的可能。
- 慢响应页面:单个页面响应时间过长,会直接压缩这一轮能抓的数量。
做一次低成本的日志盘点
- 取最近 7 天以上的抓取日志,按目录或 URL 类型分组,而不是逐条看。
- 统计每组的状态码分布:200、301、404、5xx 各占多少。
- 看响应时间的分布,找出拖后腿的页面或接口。
- 把命中量最高的前几组 URL,拿去和导航、sitemap、内链对照,看它们是不是真的需要被收录。
- 对照之后通常会发现,浪费集中在少数几类路径上,处理其中一两类就能看到变化。
服务器这一侧也在决定上限
抓取配额再充足,如果服务器经常超时、返回 5xx,或者安全策略把正常蜘蛛也拦掉了,请求照样进不来。这部分的排查顺序一般是:先确认蜘蛛拿到的是正常 HTML 而不是拦截页,再看响应时间是否稳定,最后才去讨论内容质量。反过来,一味追求抓取频率而不解决超时,只会让更多请求失败。
减少浪费的常规动作
- 用 robots.txt 挡住明确的参数路径或功能路径,但别顺手挡住需要收录的正文。
- 用 canonical 归并重复入口,同时保证内链指向规范版本。
- 清理失效内链,把旧地址的重定向收敛成一次跳转。
- sitemap 只放规范 URL,不要把各种变体都塞进去。
- 对确实需要保留但不需要收录的页面,用合适的 noindex,而不是让它长期占着抓取。
别把配额当成收录保证
改善抓取分配,能让有效页面更容易被抓到,但它不保证一定进入索引。索引还取决于页面本身的内容、与站内其他页面的关系,以及是否有重复版本在相互竞争。抓取是入口,收录是结果,中间还隔着页面质量这一关。
一个实用的判断标准:如果日志里蜘蛛来得不少,但命中最多的一批 URL 你并不希望被收录,那问题多半出在配额分配上,而不是“蜘蛛不来”。
调整时建议一次只改一处,改完观察两到四周的日志和索引变化,再决定下一步。几处改动同时叠加,出了问题会很难判断是哪一步起的作用。