网站收录

抓取预算怎么分配:收录慢时先检查这几类 URL

收录慢的时候,先别急着提交更多 URL。搜索蜘蛛每天能抓的次数有限,如果大部分落在筛选参数、搜索结果页和重定向链上,真正想被收录的页面只能排在队尾。本文讲怎么从日志里看清抓取去向,把低价值 URL 挪出蜘蛛路径,再重新安排重要页面的抓取顺序。

网站收录

抓取预算怎么分配:收录慢时先检查这几类 URL

收录慢,先看蜘蛛把时间花在哪

很多人遇到新页面迟迟不收录,第一反应是继续提交 URL、加外链、加内链。但如果日志里搜索蜘蛛每天都在来,抓的却都不是你想收录的页面,那再加提交量,也只是把同样的路径重复走一遍。

搜索蜘蛛对单个站点的抓取量是有上限的,这个上限受站点规模、更新频率、服务器响应速度和站点整体重要性影响。它不是官方公布的固定配额,而是一种资源分配的结果:同样的抓取次数,花在筛选参数上,就少一次花在详情页上。

从日志里看清抓取去向

把最近一段时间的蜘蛛日志按目录、参数和响应码分组统计,通常能看到非常集中的分布:

  • 带排序、筛选、价格区间的参数页占了大多数;
  • 站内搜索结果页被反复抓取,尤其是把搜索词拼进 URL 的那种;
  • 按日、按月翻页的归档页一层套一层,越翻越深;
  • 同一内容存在打印版、移动版、带 utm 参数的多个副本;
  • 大量 301 链条和软 404,蜘蛛每次都要走完整个跳转;
  • 统计跳转、外链跳转这类本不该被抓的中间页。
如果八成抓取都落在这类 URL 上,新页面排在队尾也就不奇怪了。

把低价值 URL 挪出蜘蛛路径

处理时要区分「不想被抓」和「想抓但不收录」两种情况:

  1. 不想被抓的:筛选参数、站内搜索、统计跳转,用 robots.txt 屏蔽抓取。注意屏蔽抓取不等于阻止收录,如果这些 URL 已经被外部链接指向,最好连同 noindex 一起处理。
  2. 想抓但不收录的:重复的打印版、参数副本,用 noindex 或 canonical 归并,让蜘蛛进来一次就拿到明确信号,不必反复回访。
  3. 该被抓的:把 sitemap 收敛到只放真正需要收录的 URL,lastmod 写真实时间,不要每次生成都把所有条目的时间刷新一遍。
  4. 结构性支出:减少重定向层级,重要页面尽量控制在离首页三到四次点击以内,内链指向详情页而不是全部堆在首页。
  5. 响应速度:TTFB 偏高的页面抓取频率通常更低,先让重要页面快起来。

顺序上先做哪一步

优先级可以按确定性来排:先处理明确低价值的参数页和搜索结果页,这类改动通常见效最快;再处理重定向链和内链结构,属于慢变量;最后才考虑 sitemap 调整和重新提交。改完之后回头看日志,抓取分布的变化一般比收录变化来得更早,可以先把抓取分布当作观察指标,而不是只盯着收录数字。

需要说明的是,把抓取机会让给重要页面,只是让页面被看到的概率更高一些。是否最终收录,仍取决于页面本身的质量和是否存在对应的搜索需求。抓取预算管的是机会分配,管不了最后的结果。