抓取能力不是无限的
搜索引擎的蜘蛛不会因为你的站点 URL 多,就无限投入资源。它在一个站点上分配的时间与请求数大致有上限,业内通常称为抓取配额或抓取预算。站点 URL 总量越大、响应越慢、低价值页面越多,单个有价值页面能分到的抓取次数就越少。所以当你发现新页面迟迟不被抓取,问题往往不在“蜘蛛不喜欢这个站”,而在于抓取能力被别的东西占掉了。
哪些页面在争夺同一份资源
同一份抓取能力,通常会被这几类 URL 分走:
- 参数组合生成的页面。筛选、排序、分页参数可以组合出成千上万个 URL,内容却高度相似。
- 有效期很短的页面。活动页、临时专题,上线几天就下线,蜘蛛抓完就没用了。
- 重复入口。同一篇内容通过不同域名、http 与 https、带 www 与不带 www 同时开放抓取。
- 低价值的分页和归档。一个标签下面挂几十页,翻到第八页已经没人看,蜘蛛仍可能逐页抓取。
- 站点地图里混进的废弃地址。已经 404 或重定向的 URL 还留在 sitemap 中,每抓一次就浪费一次请求。
先做减法,再做加法
想提升收录效率,第一步往往不是催蜘蛛多来,而是让它少去没用的地方。可以按下面的顺序处理:
- 把站点 URL 拉成一张清单,按“有搜索价值 / 有用户价值 / 两者都没有”粗略分层。
- 对确认无价值的参数页做收敛。robots.txt 与 noindex 效果不同:前者不让抓取,后者抓取后不进索引,要看清楚再选。
- 把 sitemap 精简到只放需要收录的规范 URL,并保证里面的地址都能正常访问。
- 检查内链是否把大量入口导向无关页面,比如页脚的全站标签云。
- 确认服务器响应时间稳定,慢响应会直接压缩同样时间里蜘蛛能抓的页数。
抓取问题与收录问题要分开看
“蜘蛛没来”和“来了没收”是两类问题,处理手段不同。日志里完全没有该 URL 的请求记录,说明它还没被发现,或者被 robots 拦住了,这时要解决的是入口和可发现性;日志里有请求、但索引里查不到,说明页面已经被拿到,接下来是内容质量与规范层面的判断。把两件事混在一起,容易做出无效动作,比如为了催收录反复提交同一个地址,实际并没有改变蜘蛛对页面的评估。
几个容易被忽略的细节
- 抓取次数下降有时是正常的。重复 URL 清理干净、站点结构收敛之后,蜘蛛来的次数反而会变少,但每次抓的页面更准。
- 新站或新目录前期抓取慢很常见。与其频繁改动结构,不如保持稳定,持续输出有独立价值的页面。
- 重要页面应该有稳定入口,点击深度过深,在配额竞争里就会排在后面。
- 不要把“提交了 URL”等同于“已经抓取”。提交只是把地址放进待办队列,何时轮到它,仍取决于站点的整体状态。
抓取配额这件事,能优化的部分主要是减少浪费,而不是逼蜘蛛多投入。把无效 URL 收敛干净、把入口理顺,剩下的交给内容本身。