網站收錄

抓取预算被谁消耗了:從日誌里找出高频低價值 URL

很多站点抓取量不低,但有效頁面收錄慢,原因可能是抓取被大量低價值 URL 分摊。本文從日誌出發,识別分頁、篩選參數、标簽聚合、站内搜尋等高频消耗項,並给出收敛顺序,帮助有效頁面获得更多抓取机會。

網站收錄

抓取预算被谁消耗了:從日誌里找出高频低價值 URL

很多站長看抓取日誌时,只關注蜘蛛有没有来。但更值得看的是:蜘蛛把時間花在了哪些 URL 上。抓取资源不是無限供應,如果大量低價值 URL 被频繁抓取,真正希望被收錄的頁面就會排得更靠後。

抓取预算不是固定配額,但會被分摊

搜尋引擎没有公開一個固定數值的“抓取预算”,但抓取频率确實受站点規模、更新频率、服務器响應速度、頁面质量等因素影响。可以把它理解成一種動態分配:蜘蛛愿意给這個站多少抓取机會,以及這些机會怎么分。低價值 URL 拿得越多,有效頁面拿到的就越少。

從日誌里找出高频消耗項

先按蜘蛛 UA 過滤日誌,再按 URL 聚合請求次數、狀態碼和平均响應時間。重点看那些被抓取很多、但從未带来搜尋流量的路径。

  • 分頁連結:page/2 之後的頁面如果内容重复,通常不值得反复抓取。
  • 篩選和排序參數:?color=red&size=m 這類组合容易生成大量相似 URL。
  • 标簽和聚合頁:内容稀薄、互相重复时,會持續消耗抓取。
  • 站内搜尋结果頁:參數化 URL 大多没有獨立收錄價值。
  • 會话 ID 和追踪參數:同一頁面出現多個 URL 版本。
  • 404 和重定向鏈:蜘蛛反复訪問舊連結,會占用抓取机會。
  • sitemap 中的低價值 URL:主動提交等于主動引導抓取。

判断低價值的两個标准

一是這個 URL 有没有獨立的搜尋需求;二是它與其他頁面是否高度重复。两者都不满足时,通常不值得占用抓取资源。

收敛顺序:先堵入口,再清 sitemap

  1. 内部連結:先移除或减少指向低價值 URL 的入口,尤其是全站導航和頁脚。
  2. robots.txt:對确定不收錄的目錄或參數做 disallow,注意不要誤封需要抓取的 CSS、JS 和图片。
  3. canonical:對保留但重复的頁面,指向主版本,帮助搜尋引擎合並信号。
  4. sitemap:只保留希望被收錄的 URL,移除參數頁、聚合頁和已失效連結。
  5. 服務器端:對確認無價值的 URL 返回 410,或 301 到相關的主頁面,减少反复抓取。

顺序有讲究。只清 sitemap 但内部連結還在大量輸出,蜘蛛仍會從別處發現這些 URL。只做 robots 而不清理服務器响應,已發現的 URL 也可能繼續产生抓取請求。

收敛後观察什么

观察日誌中目标頁面的抓取频次、狀態碼和首次發現時間。不要期待調整後立刻收錄,抓取和索引更新都需要周期。同时检查目标頁面是否响應過慢,服務器延迟本身也會影响抓取频率。

抓取優化的目标不是让蜘蛛来得更多,而是让蜘蛛把時間花在真正希望被收錄的 URL 上。

常见誤区

  • 用 robots 一刀切屏蔽所有參數,结果誤伤正常頁面。
  • 只清理 sitemap,内部連結和導航仍在輸出低價值 URL。
  • 把抓取量当成收錄量,忽略頁面质量和重复内容問题。
  • 反复提交低價值 URL,以為能加速收錄,反而挤占有效抓取。

先從日誌里找出消耗抓取最多的那几類 URL,再决定收敛顺序。每次只改一两項,观察一個周期後再調整,比一次性大規模屏蔽更稳妥。