網站收錄

抓取预算被谁消耗掉了:收錄慢时先做一次抓取盘点

蜘蛛不来往往只是表象,更多时候是抓取机會被參數頁、聚合頁和软 404 消耗掉了。這篇文章给出一套用服務器日誌做抓取盘点的顺序,從抓取分布、入口暴露到响應速度逐項核對,帮你判断收錄慢到底卡在哪一环。

網站收錄

抓取预算被谁消耗掉了:收錄慢时先做一次抓取盘点

新頁面發布後迟迟没有收錄反馈时,很多人第一反應是“蜘蛛没来”。但看日誌往往會發現,蜘蛛其實一直在抓,只是把抓取机會花在了別的地方。與其反复提交 URL,不如先做一次抓取盘点:看清蜘蛛最近抓了什么、為什么抓、這些 URL 值不值得抓。

抓取预算不是一個固定數字

搜尋引擎不會给每個站点發一個額度表式的東西。更接近實际的描述是:站点能承受多少並發請求、响應有多快、内容更新频率如何,共同决定了蜘蛛在一段時間内愿意来多少趟。业内习惯把這部分抓取能力叫“抓取预算”,它没有官方口径,但拿来做排查框架是够用的。

需要提醒的是,预算並不是越多越好。让蜘蛛把時間花在低價值 URL 上,和减少抓取次數,本质上是同一件事的两種表現。

先看日誌:蜘蛛到底在抓什么

取最近一到两周的服務器日誌,篩選主流蜘蛛的 UA,把抓取 URL 按目錄和路径特征分组。重点不是總量,而是比例。

  • 參數组合頁占比:带 sort、filter、page 這類參數的 URL 占了多少抓取次數。
  • 分頁與列表:列表頁、翻頁頁、归档頁被抓的深度和频次。
  • 重复路径:同一篇内容是否存在多個 URL 變体被反复抓取。
  • 狀態碼分布:200、301、404、5xx 各占多少,响應時間集中在哪個区間。
  • 新頁面:最近發布的内容有没有出現在日誌里,第一次被抓是什么时候。

別忘了拉長時間维度

只看一天的日誌容易被誤導。建议按周對比:如果總抓取量下降但新頁面抓取量没變,說明能力被压缩了;如果總量不變而參數頁占比上升,說明站内暴露的入口變多了。

常见的抓取消耗源

  • 站内搜尋结果頁允许被抓,且能被外部連結或站内入口触達。
  • 篩選與排序组合在列表頁上無限制生成可点击連結。
  • 日歷、标簽、作者等聚合頁數量大、内容稀薄,却能無限翻頁。
  • 软 404:错誤頁返回 200,蜘蛛會反复回头確認。
  • 重定向鏈條:内部連結指向舊地址,跳一次才到目标頁。
  • 响應偏慢:同样的並發下,能抓完的頁面數量被拖低。
  • 站点地图推送里混進了大量低價值 URL,等于主動邀請抓取。

核對顺序建议

  1. 按目錄統計抓取分布,找出占比最高的低價值類型。
  2. 確認這些 URL 有没有站内入口,尤其是有没有可点击連結或站点地图條目。
  3. 检查服務端响應時間與错誤率,技術問题優先于内容問题處理。
  4. 對不需要被抓的類型,先收口入口,再考虑 robots 或 noindex。
  5. 處理後再观察一到两周日誌,看抓取是否向重要目錄迁移。
不要一邊在 robots.txt 里放開參數頁,一邊期待蜘蛛優先抓正文頁。入口在哪里,抓取就會跟到哪里。

處理时容易忽略的几点

第一,收口不等于屏蔽。很多參數頁是用戶正常浏览路径的一部分,動手前要確認會不會影响站内体驗。第二,lastmod 频繁變動會让蜘蛛重复回訪,站点地图里的時間最好反映真實的内容變更。第三,抓取量上升不等于收錄上升,抓得勤但頁面质量不够,依然會停在“已發現”阶段。

小结

收錄慢的时候,先別急着提高提交频率。用日誌做一次抓取盘点,把蜘蛛實际消耗掉的机會列出来,通常比盲目提交更容易定位問题。抓取结构的調整是長期活,观察周期至少以周為單位,而不是以天為單位。