网站收录

抓取能力是有限的:同一份配额里哪些页面在争夺

蜘蛛在一个站点上分配的抓取能力大致有上限。URL 总量越大、低价值页面越多,单个有价值页面分到的抓取次数就越少。这篇文章说明哪些 URL 在消耗配额、如何用 robots、noindex 与 sitemap 做收敛,以及怎样把抓取问题和收录问题分开判断。

网站收录

抓取能力是有限的:同一份配额里哪些页面在争夺

抓取能力不是无限的

搜索引擎的蜘蛛不会因为你的站点 URL 多,就无限投入资源。它在一个站点上分配的时间与请求数大致有上限,业内通常称为抓取配额或抓取预算。站点 URL 总量越大、响应越慢、低价值页面越多,单个有价值页面能分到的抓取次数就越少。所以当你发现新页面迟迟不被抓取,问题往往不在“蜘蛛不喜欢这个站”,而在于抓取能力被别的东西占掉了。

哪些页面在争夺同一份资源

同一份抓取能力,通常会被这几类 URL 分走:

  • 参数组合生成的页面。筛选、排序、分页参数可以组合出成千上万个 URL,内容却高度相似。
  • 有效期很短的页面。活动页、临时专题,上线几天就下线,蜘蛛抓完就没用了。
  • 重复入口。同一篇内容通过不同域名、http 与 https、带 www 与不带 www 同时开放抓取。
  • 低价值的分页和归档。一个标签下面挂几十页,翻到第八页已经没人看,蜘蛛仍可能逐页抓取。
  • 站点地图里混进的废弃地址。已经 404 或重定向的 URL 还留在 sitemap 中,每抓一次就浪费一次请求。

先做减法,再做加法

想提升收录效率,第一步往往不是催蜘蛛多来,而是让它少去没用的地方。可以按下面的顺序处理:

  1. 把站点 URL 拉成一张清单,按“有搜索价值 / 有用户价值 / 两者都没有”粗略分层。
  2. 对确认无价值的参数页做收敛。robots.txt 与 noindex 效果不同:前者不让抓取,后者抓取后不进索引,要看清楚再选。
  3. 把 sitemap 精简到只放需要收录的规范 URL,并保证里面的地址都能正常访问。
  4. 检查内链是否把大量入口导向无关页面,比如页脚的全站标签云。
  5. 确认服务器响应时间稳定,慢响应会直接压缩同样时间里蜘蛛能抓的页数。

抓取问题与收录问题要分开看

“蜘蛛没来”和“来了没收”是两类问题,处理手段不同。日志里完全没有该 URL 的请求记录,说明它还没被发现,或者被 robots 拦住了,这时要解决的是入口和可发现性;日志里有请求、但索引里查不到,说明页面已经被拿到,接下来是内容质量与规范层面的判断。把两件事混在一起,容易做出无效动作,比如为了催收录反复提交同一个地址,实际并没有改变蜘蛛对页面的评估。

几个容易被忽略的细节

  • 抓取次数下降有时是正常的。重复 URL 清理干净、站点结构收敛之后,蜘蛛来的次数反而会变少,但每次抓的页面更准。
  • 新站或新目录前期抓取慢很常见。与其频繁改动结构,不如保持稳定,持续输出有独立价值的页面。
  • 重要页面应该有稳定入口,点击深度过深,在配额竞争里就会排在后面。
  • 不要把“提交了 URL”等同于“已经抓取”。提交只是把地址放进待办队列,何时轮到它,仍取决于站点的整体状态。
抓取配额这件事,能优化的部分主要是减少浪费,而不是逼蜘蛛多投入。把无效 URL 收敛干净、把入口理顺,剩下的交给内容本身。