先把“抓取预算”这个词拆开
很多站长把抓取预算理解成搜索引擎每天分配给某个站点的抓取条数,好像一个额度,用完了就等第二天。实际更接近一个结果:搜索引擎在有限的资源下,根据站点的重要性、更新频率、服务器响应速度,决定在你这里停留多久、抓多少个 URL。所以它不是可以申请或调高的数值,而是站点自身条件算出来的结果。
理解这一点,很多现象就顺了:同一个站,内容没怎么变,抓取量却下降,通常不是被扣了额度,而是同一时间有别的站点、别的页面更值得抓。
蜘蛛的时间通常花在哪几类页面上
重复的 URL 组合
筛选、排序、分页、跟踪参数,如果都能返回 200 且内容高度相似,每一个组合都可能被当成一个新地址抓一次。理论上几千个页面,实际可能生成几万个可抓 URL。
低价值页面和软 404
空搜索结果页、没有内容的标签页、返回 200 但正文为空的页面,会持续消耗抓取时间,却不带来索引价值。
入口很深的页面
需要点五六层才能到达的页面,被发现的机会本来就少,抓取优先级也低。站点越大,这个问题越明显。
把抓取时间引到重要页面的做法
- 收敛 URL:对参数页面做统一处理,用 canonical、robots 或合适的状态码收口,别让同一份内容有几十个入口。
- 内链指向要抓的页面:栏目页、聚合页、正文之间的相关链接,是蜘蛛走路的路径。把重要页面放在离首页更近的位置。
- 保持 sitemap 干净:只放需要收录的规范地址,及时删掉已下线的 URL,不要把所有参数地址都塞进去。
- 处理软 404 和空页面:没有内容就返回 404 或 410,或者把内容补齐,别让它一直以 200 状态挂着。
- 保证响应速度:服务器慢,蜘蛛抓一个页面要等很久,单位时间能抓的数量自然变少。
观察:日志和抓取统计比猜测可靠
服务器日志能看到蜘蛛每天来了多少次、抓了哪些地址、返回什么状态码;搜索后台的抓取统计能看到抓取请求总量和响应情况。把两边对照,很容易发现是哪一类 URL 在吃掉大量请求。
如果日志里出现大量参数页、分页、空页面被抓,而正文页抓得很少,问题多半出在站点结构和 URL 管理上,而不是别的站点抢走了机会。
几个容易搞反的地方
- 抓取多不等于收录多。抓取只是把页面拿回去看,收不收还要看内容质量和重复判断,前者只是后者的前置条件。
- 提交 sitemap 不等于优先抓取。它主要帮助发现 URL,并不会改变抓取优先级顺序。
- 靠外部批量制造入口意义有限。人为堆出来的链接如果指向低质量页面,只会让抓取时间花在更不值得的地方,对收录没有实质帮助。
- 抓取量短期波动很正常。看趋势比看单日数字更有参考价值。
说到底,抓取预算的改善来自站点本身:URL 更干净、结构更清楚、重要页面更容易被找到。这三件事做到位,抓取时间自然会往该去的地方走,收录效率也会跟着变化。