搜尋抓取

抓取配額的分配逻辑:让蜘蛛的有限訪問落在真正需要的 URL 上

蜘蛛對單個站点的訪問量在一段時間内是相對稳定的,同一域名下所有可抓取 URL 都在分這批次數。本文從内鏈结构、Sitemap、服務器响應速度、重复與低價值 URL 几個角度,說明配額大概被什么分掉,以及站点侧可以做哪些取舍和观察。

搜尋抓取

抓取配額的分配逻辑:让蜘蛛的有限訪問落在真正需要的 URL 上

很多站点在翻看蜘蛛日誌时會有一種直观感受:蜘蛛来得不少,但抓来抓去總是那几個頁面,真正想让搜尋引擎看到的 URL 反而迟迟没有動静。這背後通常不是蜘蛛在针對谁,而是抓取配額的分配問题。

蜘蛛的訪問次數不是無限的

搜尋引擎不會给某個站点一個公開的、固定的抓取次數,但實际行為上,每個站点在一段時間内能获得的請求量是相對稳定的。這個量由站点体量、更新频率、响應速度、歷史抓取效果等多方面因素共同影响。理解這一点,比纠结具体數字更有用。

既然是有限的,就意味着存在竞争:同一域名下所有可被抓取的 URL,都在分這一批訪問次數。低價值 URL 多被抓一次,高價值 URL 就少了一次机會。

哪些 URL 在悄悄消耗配額

  • 參數组合产生的重复列表頁,例如排序、篩選互相叠加。
  • 返回 200 但内容為空的软 404 頁面,蜘蛛走一趟什么也没拿到。
  • 层层跳轉的重定向鏈路,每一次跳轉都是一次額外請求。
  • 体积大、加载慢的頁面,抓取一個要占用更長時間。
  • 已確認没有收錄價值,却被内鏈反复指向的 URL。
判断标准不是“這個頁面重不重要”,而是“它值不值得占用一次請求”。

内鏈结构决定了先抓谁

蜘蛛没有全站地图,它靠連結一步步走。首頁、主導航、栏目列表、面包屑上的連結,天然更容易被反复訪問,也更容易被安排重新抓取。藏在深處的頁面,如果只有一两條内鏈指向,往往要等很久。

如果希望某批 URL 被更快發現,先检查它們是否出現在稳定的、靠近首頁的内鏈路径上,而不是只躺在 Sitemap 里等。

Sitemap 提供候選,不决定顺序

Sitemap 的作用是把 URL 清單交给蜘蛛,它解决的是“知不知道存在”,並不解决“什么时候抓”。清單里的 URL 越杂,單個 URL 被安排到的時間可能越靠後。所以 Sitemap 應该保持干净,只放真正希望被收錄的規范 URL,而不是把全站所有參數變体都塞進去。

服務器响應速度直接換算成配額

抓取是一個請求對應一個响應進行的。响應慢,蜘蛛在同样時間内能完成的請求數就少;返回 5xx 或者長時間超时,還可能触發更保守的抓取频率。對中小站点来说,把首字节時間控制在一個合理范围内,往往比做很多技巧性優化更實在。

  • 检查是否存在慢查询或没有缓存的動態頁面。
  • 確認 CDN 回源不是瓶颈。
  • 尽量避免在蜘蛛訪問高峰做大規模發布或重建。

观察與調整的简單做法

  1. 按目錄或路径前缀統計日誌,看訪問量集中在哪几類 URL 上。
  2. 列出訪問量高但長期没有收錄價值的路径,考虑收口或屏蔽。
  3. 對比調整前後,重点看抓取分布是否變化,而不是總量是否暴涨。
  4. 對确實重要的新頁面,主動构建内鏈入口,並保持 URL 長期稳定。

几個容易踩的誤区

把抓取量下降一律理解成“被惩罚”,通常並不成立。站点内容變少、响應變慢、大量重复 URL 出現,都會让蜘蛛减少訪問。反過来,抓取量上升也不等于收錄變好——如果上升的是一堆無價值頁面,那只是另一種形式的浪費。

配額管理的本质是取舍:让有限的一次抓取,落在真正需要被看到的 URL 上。