網站收錄

蜘蛛的抓取量被谁吃掉了:低價值 URL 的清理顺序

搜尋蜘蛛的抓取次數是有限的,參數頁、站内搜尋頁、失效跳轉這些低價值地址會把額度吃掉,让真正需要更新的内容排不上队。本文梳理什么情况下该關注抓取配額、常见的消耗来源,以及從内鏈、robots.txt、noindex 到 sitemap 的清理顺序和观察指标。

網站收錄

蜘蛛的抓取量被谁吃掉了:低價值 URL 的清理顺序

站点越大,越容易遇到一個現象:内頁没被抓几次,日誌里却天天出現一堆參數頁、篩選頁和重复地址。搜尋蜘蛛的抓取能力是有限的,把額度花在低價值 URL 上,真正需要更新的頁面就排不上队。這篇文章讲的就是抓取配額的分配問题,重点在识別和清理。

抓取配額是什么,什么时候才需要在意

抓取配額不是官方公布的一個數字,而是搜尋引擎在一段時間内愿意花在一個站点上的抓取請求總量。它和站点規模、更新频率、服務器响應速度、頁面本身的價值都有關系。

小站点通常不用太担心這件事——頁面總共几百個,蜘蛛几轮就爬完了。真正需要關注的是下面几種情况:

  • 已收錄 URL 數以萬計,但每天新增内容只有几十條;
  • 日誌里大量請求打在同一個路径模式上,比如带排序參數的列表頁;
  • 服務器响應偏慢,或者经常返回 5xx,让蜘蛛主動减速。

如果符合其中几條,清理低價值 URL 的收益會比較明顯。

哪些 URL 最容易吃掉抓取量

  • 排序、篩選、追踪參數组合出来的無限地址,例如 ?sort=、?filter=、?utm_=;
  • 翻到很深层次、内容重复度又高的分頁;
  • 站内搜尋结果頁;
  • 會话 ID、打印頁、日歷跳轉這類功能頁;
  • 已经失效、却還挂着連結並一路 302 到新地址的舊路径;
  • 數量膨胀、内容稀薄的标簽頁和作者頁;
  • 由參數意外拼出的無意义组合地址。

這些地址未必都是错的。判断标准不是好看不好看,而是有没有獨立的检索價值。

清理顺序:先堵入口,再改信号

第一步:减少站内連結的暴露

蜘蛛主要跟着連結走。如果篩選頁、搜尋頁广泛出現在導航和正文里,它們就會被反复抓取。把這類入口收進頁面内的交互,或者用 nofollow 降低權重传递,通常比事後處理更有效。

第二步:用 robots.txt 挡住不值得抓的路径

robots.txt 适合處理那些永遠不需要被检索、但地址會被大量生成的路径,比如站内搜尋、购物车、後台工具頁。

這里有一條常被誤解的規則:robots.txt 只阻止抓取,不负责把已索引的頁面移除。如果某個地址已经進了索引,必须在頁面上加 noindex,或者让它返回 404、410,才有机會被移出去。

第三步:用 noindex 和 canonical 處理重复頁面

同一内容存在多個地址时,canonical 指向主版本;主版本如果不需要收錄,再加 noindex。两個信号不要互相矛盾——一邊 canonical 指向 A,一邊又把 A 标成 noindex,蜘蛛會無所适從。

第四步:让 sitemap 只保留值得抓的 URL

sitemap 是给蜘蛛的優先級提示。把參數頁、失效頁塞進去,等于主動邀請它去抓没有價值的東西。定期清理,只留需要收錄的規范地址。

怎么判断清理有没有生效

不要只盯着索引量,索引量受太多因素影响,波動也大。更直接的观察点是:

  • 抓取統計里各類响應碼的比例變化,200、301、404、5xx 各占多少;
  • 平均响應時間有没有下降;
  • 日誌里低價值路径的請求次數是否减少;
  • 新發布頁面的首次抓取時間有没有提前。

這些變化通常要几周才能看出趋势。中間不要频繁改策略,否則分不清是哪個動作起了作用。

几個容易走偏的地方

  • 為了省抓取量把所有列表頁都 noindex,结果分類頁的自然流量一起没了——先想清楚哪些頁面有真實检索需求;
  • 用 robots.txt 挡住已经索引的頁面,以為能删掉它們,實际上索引里還留着;
  • 服務器经常超时,却把問题全算在蜘蛛头上——响應速度是抓取频率的基础;
  • 只清理 sitemap,不動内鏈,蜘蛛照样顺着連結爬過来。
抓取配額的優化本质上是一次取舍:把有限的抓取次數,交给用戶真正會搜、内容真正會變的頁面。

落地时可以先做一件事:從日誌里拉出一周的抓取记錄,按路径分组,看請求量排在前 20 的是哪些 URL,再判断它們值不值得被這样频繁抓取。這份清單往往比任何理论都更直接。