网站收录

抓取预算被谁吃掉了:收录上不去时先排查这几类 URL

收录停滞时,很多站长第一反应是继续提交更多页面,但搜索引擎每天的抓取次数大致有限,站内可抓的无效 URL 越多,好页面分到的比例就越小。这篇文章从日志入手,讲清哪些 URL 在消耗抓取量、如何做减法,以及腾出来的预算该留给谁。

网站收录

抓取预算被谁吃掉了:收录上不去时先排查这几类 URL

很多站点收录上不去,第一反应是「提交得还不够多」,于是继续加页面、加栏目、加参数组合。但如果搜索引擎每天来抓的次数大致固定,站内可抓的 URL 却翻了几倍,新页面反而更难排上队。这篇文章讲的是:在收录停滞时,先把被浪费掉的抓取次数找回来。

抓取预算不是玄学,就是有限的访问次数

搜索引擎对每个站点分配的抓取量,取决于站点体量、响应速度、内容更新频率和整体质量。它不是一个可以申请调高的固定配额,而是一个动态估算值:站点响应越快、返回的有效内容越多,这个值通常越容易往上走。

关键在于,抓取量分给谁由算法决定,但站内存在多少「可抓但没价值」的 URL,是由我们自己决定的。无效 URL 越多,正文页分到的比例就越小。

先看日志:抓取量被哪几类 URL 吃掉了

把最近一个月的服务器日志按状态码、路径规则、抓取频次做一次聚合,通常会看到下面几类占了大头。

带参数的筛选与排序

排序方式、价格区间、颜色尺码等参数组合,动辄生成成百上千个 URL。它们内容高度相似,却每次都要占用一次抓取和一次渲染。

已经失效的历史 URL

改版、下架、栏目调整后留下的地址,如果一直返回 200 的空壳页或 302 到首页,蜘蛛会反复回来确认。持续的无效抓取比直接报错更浪费。

重定向链与跳转中间页

一个地址跳三次才到最终页面,中间每个环节都可能被单独抓取。链条越长,浪费越明显。

内容几乎相同的列表页

标签、归档、日期、作者等自动列表页,如果彼此内容差异很小,又都在站内互相链接,也会形成一轮轮重复抓取。

做减法的三个动作

  1. 屏蔽没有独立价值的参数组合。用 robots.txt 或站内规则限制筛选、排序类参数,但要注意别把带参数的正文页一起屏蔽掉,那会直接把可收录内容挡在门外。
  2. 失效地址直接返回 404 或 410。不要让已经不存在的页面长期 302 到首页,也不要用 200 返回一个「内容不存在」的空页。
  3. 收窄自动列表页的入口。对分页、筛选、归档类页面,选择 noindex 或减少站内链接暴露,避免它们和正文页争夺同一份抓取量。

腾出来的预算留给谁

做减法不是目的,把抓取量转移到真正需要收录的页面上才是。

  • 新发布且内容完整的正文页。
  • 需要更新旧版本信息的核心页面,这类页面重新抓取后往往能直接刷新搜索结果。
  • 有站内入口或站外链接支撑、但长期停留在「已发现未编入索引」的页面。

如果顺序反过来,先把预算花在低价值页面上,正文页就只能排队。

两个容易踩的误区

第一,蜘蛛来访次数变多,不等于收录会变快。日志里抓取量上涨,可能只是它在反复确认一批无效 URL,正文页的抓取次数并没有变化。

第二,屏蔽参数不等于屏蔽参数页上的内容。很多正文页本身带参数,屏蔽前务必先用少量 URL 测试,确认不会误伤。

怎么判断有没有效果

调整之后,不要只看「收录总量」这一个数字,而是观察两项结构变化:日志里正文页抓取占比是否上升,以及「已发现未编入索引」的数量是否在下降。这两项通常需要两到四周才能看出趋势,短期的波动说明不了什么。收录本质上是抓取、内容质量和站内结构共同作用的结果,把无效抓取减下去,只是把机会腾出来,并不能保证每个页面都被收录。