搜尋抓取

抓取配額被谁吃掉了:把蜘蛛的訪問次數花在關键 URL 上

蜘蛛每天来訪多少次並没有标准答案,但每次成功抓取都是一次成本。本文從參數副本、會话連結、错誤狀態碼、深分頁等常见消耗点出發,讲清如何用日誌排查配額去向,並通過内鏈、Sitemap 和响應速度把抓取引導到真正需要更新的 URL 上。

搜尋抓取

抓取配額被谁吃掉了:把蜘蛛的訪問次數花在關键 URL 上

很多站長會問:蜘蛛一天到底来訪多少次?這個數字没有统一答案,搜尋引擎也不會公開。但有一個更實用的思路:把蜘蛛每一次成功抓取都当成一次成本,看它被花在了哪些 URL 上。消耗得越多、回报越低的頁面,就越值得收敛。

抓取配額不是一個固定數字

搜尋引擎的抓取能力受限于自身基础设施,也受限于你的服務器。它通常會在三類信号之間做平衡:

  • 站点容量:服務器响應速度、错誤率、是否频繁超时。
  • 抓取需求:站点更新频率、Sitemap 與内鏈暴露出的 URL 數量。
  • 頁面價值:外鏈、歷史点击、内容是否長期不變。

所以“配額”不是每天固定發多少張票,而是一個動態结果。服務器越稳、反馈越明确,蜘蛛越愿意多来;如果它總是撞上超时和重复内容,来一趟的意愿就會下降。

配額容易被吃掉的几類 URL

參數與排序副本

篩選、排序、追踪參數會生成大量内容相近的頁面。蜘蛛顺着連結一路抓下去,可能把大部分訪問用在几乎相同的列表上。處理时可以優先保留一到两種參數组合,其余用 canonical 或 robots 規則收敛。

會话语义和临时連結

URL 里带會话 ID、時間戳、随机 token,會让蜘蛛每次都当成新頁面。這類連結應尽量不寫進正文内鏈,也不要交给 Sitemap。

狀態碼混乱的頁面

空结果頁返回 200、下架商品返回 200、错誤頁也返回 200,都會让蜘蛛反复回訪同一批無價值 URL。這類頁面该 404 就 404,该 410 就 410,不要用 200 掩盖。

深分頁與归档

翻到几十頁以後的列表,單頁價值低但數量巨大。可以限制可翻頁范围,归档頁只保留按時間聚合的入口,减少蜘蛛在尾部停留。

自查:從日誌里看配額去了哪

把最近一周的日誌按目錄或 URL 前缀聚合,重点看三個數:

  1. 每個目錄被抓取的總次數,以及其中返回 200 的比例。
  2. 响應時間的分布,慢的目錄往往會让蜘蛛提前收手。
  3. 被抓取最多的 URL 是否包含你並不關心的參數頁或空结果頁。

如果某一類 URL 抓取量很大、内容却几乎不變,基本可以判定是配額浪費点。

抓取量下降时,先別急着加外鏈,先確認蜘蛛是不是把訪問次數花在了重复和無效的頁面上。

把配額引導到關键 URL 的几個動作

  • 内鏈指向規范頁:正文里只鏈主版本 URL,不要同时给出带參數的副本。
  • Sitemap 只放主 URL:把希望被抓的頁面寫清楚,不要把所有參數组合都塞進去。
  • 加快首字节响應:减少重定向鏈、避免同步外部請求,让重要目錄稳定在合理耗时内。
  • 更新即暴露:新内容發布後,從首頁或栏目頁给它一個可点击入口,比只放 Sitemap 更容易被走到。
  • 区分该抓和不该抓:该抓的保證可訪問、可渲染;不该抓的用明确規則挡住,而不是靠运气。

用一段時間观察,而不是一天

抓取行為有波動,單日資料說明不了太多。調整規則後,观察两到四周的抓取分布是否變化:重要目錄的 200 抓取是否上升,參數頁是否下降,错誤率是否收敛。只要方向對,就繼續;没變化,再回到日誌里找原因。

配額管理的目标不是让蜘蛛来得更勤,而是让每一次来訪都落在會變化、有價值的 URL 上。