网站收录

蜘蛛每天只抓几十个页面:把有限抓取额度用在关键页面上的顺序

蜘蛛每天只来几十次,不代表站点被限流,更多是搜索引擎对抓取资源的分配。这篇文章从日志归类入手,先找出被参数页、重定向、404 消耗掉的抓取次数,再通过缩短点击深度、精简 Sitemap、收敛低价值 URL,把有限的抓取额度留给真正重要的页面。

网站收录

蜘蛛每天只抓几十个页面:把有限抓取额度用在关键页面上的顺序

不少站长看服务器日志时会发现,蜘蛛每天只来几十次,抓两下就走了。这很容易让人怀疑是不是被限流或者被降权。实际情况通常更平淡:搜索引擎没有公开的每日配额表,它更像是在分配资源——根据站点规模、更新频率、页面质量、服务器响应情况,决定愿意在一个站点上花多少时间。额度少,往往不是惩罚,而是这个站点目前可抓取的价值密度不高。

先看清抓取次数落在哪些 URL 上

在动手优化之前,先做一件事:把一段时间的日志按 URL 类型归类,看清楚蜘蛛到底在抓什么。常见的几类分别是:

  • 内容页、详情页
  • 栏目页、列表页、分页
  • 站内搜索结果页、筛选参数组合页
  • 图片、CSS、JS 等静态资源
  • 404、410 以及各种跳转
  • 接口、后台、临时测试路径

如果前三类里的内容页占比很低,而参数页、静态资源、错误页占了大多数,那就说明抓取精力被消耗在了价值不高的地方,这是最该先处理的部分。

常见的几种浪费

参数组合与无限筛选

筛选页每多一个条件,就可能多出一批 URL,组合数量轻易上万。蜘蛛会不断尝试,但这些组合页几乎没有独立内容,抓了也很难带来有效收录。

多跳重定向

A 跳到 B、B 又跳到 C 的链式跳转,每一次都要多消耗一次请求。跳转链越长,浪费越明显,最好把链路压到一跳直达最终地址。

长期存在的大量错误返回码

如果站点里长期挂着大批 404、410,蜘蛛仍会反复确认这些地址是否恢复,这部分抓取基本没有产出。

体积过大与响应偏慢的页面

一个几 MB 的页面和一个两百 KB 的页面,占用的抓取时间差很多。服务器响应时间偏高时,同样的时间能抓的页面数量会明显减少。

让重要页面更容易被抓到

缩短点击深度

从首页到内容页的层级越浅,蜘蛛在有限次数内越容易触达。如果详情页只能从很深的列表或站内搜索进入,被抓到的概率自然低。

给出稳定、明确的内链入口

  • 栏目页指向最新或最值得看的几篇内容
  • 正文内的相关推荐保持真实相关性
  • 列表链接尽量直接输出在 HTML 里,不要全依赖异步加载

Sitemap 只放希望被收录的 URL

把参数页、搜索结果页也塞进 Sitemap,等于主动扩大抓取面,让蜘蛛把时间花在你并不需要的地方。Sitemap 是提示优先级的工具,不是收录保证。

与其提交一万个 URL,不如让几百个真正重要的地址被稳定抓到。

更新时给出可感知的信号

新内容上线后,从已经有抓取频率的页面加一条内链进去,通常比孤立发布更容易被发现。老页面有实质更新时,也可以从相关页面重新建立入口。

收敛低价值 URL

  1. 先判断这类页面是否真有独立价值,别急着全删
  2. 纯组合型参数页若不需被索引,优先用 robots.txt 屏蔽抓取
  3. 需要保留但不想进索引的,用 noindex,注意它仍需要被抓取一次才能读到指令
  4. 内容重复的多个地址,用 canonical 收敛到主版本
  5. 分页按实际需要决定保留几层,越靠后的页码价值越低

服务器层面也别忽略

响应时间是否稳定、有没有频繁的 5xx、是否存在对蜘蛛返回不同内容的情况,都会影响搜索引擎愿不愿意多来。这些可以先从服务器监控里的响应时间趋势看出来。

用数据验证,而不是凭感觉

调整完隔几周再对比一次日志:内容页的抓取占比有没有上升,新 URL 从发布到首次被抓的间隔有没有缩短,收录数量有没有随之变化。抓取额度不是一天就能提上去的,它更像是站点整体质量的副产品。短期内能做好的,是别把有限的请求浪费在没有价值的地址上。