先理解:抓取预算不是一个开关
很多人把抓取预算理解成搜索引擎发给每个站点的固定配额,用完就停。实际更像一个动态结果:搜索引擎会根据站点规模、更新频率、页面质量、服务器响应和链接结构,估算每天值得来抓多少次、抓哪些地址。它不是你能直接申请的额度,而是站点结构长期表现出来的一种状态。
所以当收录不理想时,“多提交几次”往往无效;真正要动的是让蜘蛛在有限时间里少走无效路径,多到目标页面。
哪些内容在悄悄消耗访问
- 同一内容的多参数地址:筛选、排序、跟踪参数各生成一份,蜘蛛逐个抓,页面却高度相似。
- 大规模低价值列表:分页很深、每页内容重复度高,抓取量大但很少进入索引。
- 失效与跳转:大量 404、软 404、多跳重定向,都会占掉请求次数。
- 慢响应:单个页面响应时间长,同一时间能抓的量自然下降。
- 被 robots 屏蔽却仍被内链大量指向的地址:蜘蛛会反复发现、反复放弃。
把页面分成三档,再决定投入
与其逐个页面纠结,不如先在站点层面做一次分类。
- 必须被收录:核心商品、核心文章、栏目主入口。它们应该获得稳定的内链入口、较短的点击深度,并在站点地图里单独列出。
- 可以收录,但不关键:旧内容、辅助说明页。保持可访问,不必刻意加内链。
- 不建议收录:筛选结果、排序页、重复的分页副本、空结果页。用合理方式收敛,而不是放任蜘蛛自由发现。
分类完成后再回头看,很多“收录不上去”的问题,其实是第一档页面没能拿到足够的抓取入口。
具体可以做的几件事
1. 收敛重复地址
同一份内容尽量只保留一个规范地址。分页、筛选参数需要保留的,保证它们指向正确的规范版本;不需要被索引的,用 meta robots 或 robots.txt 控制,但要留意两者的作用范围不同:前者阻止页面进入索引,后者阻止抓取本身。
2. 减少无效抓取
返回正确的状态码、缩短重定向链、让失效页面干脆地返回 404。这些看起来是技术细节,但它们直接决定了蜘蛛的每一次访问是否“花得值”。
3. 站点地图只放该被收录的地址
站点地图可以分成若干份,核心页面单独一份并保持 lastmod 准确;不要把参数页、已下架页面混进去。站点地图的作用是提示,不是保证被收录。
4. 用内链引导
内链既是用户路径,也是蜘蛛路径。把指向核心页面的链接放在稳定、可爬到的位置,比在页脚堆几百个链接更有效。
怎么验证调整有没有效果
不要只看总的收录数量,可以分几条线看:
- 日志里蜘蛛访问的状态码分布,404 与 3xx 的比例是否下降。
- 访问次数在目录层面的分布,核心目录是否拿到更多请求。
- 核心页面的平均抓取间隔是否缩短。
- 站点地图提交的地址与实际被抓取的地址是否接近。
抓取预算的调整属于长期工程,通常要以周为单位观察,单次改动很难立刻看到收录变化。
最后
收录是站点结构、内容质量和抓取行为共同作用的结果,不是一个可以强行打开的结果。把蜘蛛有限的访问留给真正有意义的页面,剩下的交给时间和持续维护。