网站收录

蜘蛛抓取量总是不够用:抓取预算花在哪,按什么顺序查

抓取预算不是能查到的配额,只能从服务器日志反推。这篇说清哪些站点其实不必关心它、预算常被哪几类 URL 吃掉,以及按日志、robots、内链、响应速度、重复内容的顺序该怎么查,最后给出几件能做和不该做的事。

网站收录

蜘蛛抓取量总是不够用:抓取预算花在哪,按什么顺序查

站点规模上去以后,常会听到一个说法:蜘蛛每天只来抓几十个、几百个页面,新页面排队排很久。这背后说的是抓取预算——搜索引擎愿意在一个站点上花掉的抓取资源。它不是一个固定数字,也没有地方能查到配额,只能从服务器日志里反推。

先确认:你的站真的需要关心抓取预算吗

抓取预算这件事,对小站基本不成立。几百个页面的站点,蜘蛛来一趟就能扫完,新页面迟迟不进索引,原因通常在别处:内容质量、页面响应、内链太浅。只有当页面数量明显超过蜘蛛单次抓取能力时,讨论抓取分配才有意义。

判断方法很直接:把最近 30 天的日志按蜘蛛 UA 拉出来,看三件事——每天抓取的总请求数、其中成功返回 200 的比例、新 URL 第一次被抓到距离被发现(比如 sitemap 提交或内链上线)隔了多久。如果第三个数字持续超过一两周,才值得往下查。

抓取预算容易被浪费的几个地方

1. 重定向链

每次跳转都要多消耗一次抓取。http 跳到 https,再跳到 www,再补一个尾部斜杠,一串下来一个页面要抓三四次才拿到内容。站内链接尽量直接写最终地址,不要经过跳转。

2. 参数与筛选页

排序、筛选、分页、会话 ID 这类参数,很容易组合出成千上万个 URL。它们大多内容重复、价值低,却会被内链带出来。处理顺序是先看日志里这些 URL 被抓的比例,再决定用 robots.txt 屏蔽、用 canonical 收口,还是干脆不生成可爬的链接。

3. 软 404 与空页面

返回 200 但内容是「没有找到结果」「该商品已下架」的页面,蜘蛛会当成正常页面抓取,并可能收进索引。这类页面对用户和搜索引擎都没有价值。能返回 404/410 的就返回,不能的至少加上 noindex。

4. 无限分页与归档

归档页、标签页、日历翻页,很容易形成几乎无穷的组合。保留真正有聚合价值的页面,其余收窄入口,别让蜘蛛在里面绕圈。

按什么顺序排查

  1. 看日志:确认浪费发生在哪类 URL 上,不要凭感觉改配置。
  2. 看 robots.txt:被屏蔽的目录是否还在被内链大量引用;被屏蔽的 URL 会占用发现名额,却拿不到内容。
  3. 看内链结构:重要页面离首页几步,有没有页面完全没有内链指向。
  4. 看响应时间:平均响应拉长,蜘蛛会自动降速,抓取量自然下降。
  5. 看重复 URL:同一内容存在多个地址,先合并,再谈抓取分配。
顺序很重要。先把日志看清楚,效果往往胜过盲改 robots 和参数规则。

能做的几件实事

  • 给重要页面补内链,尤其是从首页和栏目页出发的路径;
  • sitemap 只放希望被收录的 URL,并保持更新;
  • 站内链接指向最终地址,减少跳转;
  • 同一内容合并到一个主地址;
  • 清理无价值页面,让蜘蛛把时间花在有内容的地方。

这些动作都不会立刻见效,通常要观察几周,看日志里有效抓取的比例是否上升,而不是盯着某一天的抓取总量。

不建议做的事

有人会用蜘蛛池、批量外链之类的方式「引蜘蛛」。这类做法改变的是请求来源,不是站点本身的可抓取程度。短时间内日志可能变好看,但对收录没有稳定帮助,也可能带来风险。抓取分配的改善,最终还是落在站内结构、页面质量和响应速度上。

最后提醒一句:抓取量和收录量不是一回事。抓取变多不等于收录变多,还要看页面本身是否值得进索引。抓取只是把页面送到门口,进不进是另一道判断。