網站收錄

抓取预算被谁用掉了:從日誌里找出被浪費的抓取

收錄之前先有抓取,但搜尋蜘蛛在一個站点上的抓取资源是動態分配的。本文從服務器日誌出發,說明该統計哪几個關键數字、常见吃掉抓取的几類 URL,以及先堵浪費再引導抓取的處理顺序,帮你把有限的抓取机會用在對的頁面上。

網站收錄

抓取预算被谁用掉了:從日誌里找出被浪費的抓取

很多运营者每天看的是收錄量,却很少回去翻服務器日誌里的抓取记錄。但收錄要先有抓取,而搜尋引擎愿意在一個站点上花多少抓取资源,並不是固定的,也不是提交了就能拿到的。

抓取预算不是固定配額

所谓抓取预算,可以理解為搜尋引擎在一段時間内愿意分给某個站点的抓取次數上限。它受站点規模、更新频率、服務器响應速度、内容质量、歷史抓取收益等因素影响,是動態變化的。大站、更新频繁、响應稳定的站点通常能获得更多抓取;新站、長期不更新或响應偏慢的站点,抓取频次會明顯偏低。

需要先明确一点:抓取预算是机會,不是承诺。它决定的只是蜘蛛来多少次、看多少 URL,並不等于這些 URL 會被收錄。

先看日誌里的几個關键數字

分析日誌不需要复杂工具,先統計這几項就能有大致判断:

  • 一段時間内的總抓取次數,以及其中去重後的獨立 URL 數量;
  • 抓取频次最高的前几十個 URL,看它們分別属于哪種頁面類型;
  • 狀態碼分布,200、301、404、5xx 各占多少;
  • 响應時間分布,有多少請求耗时超過一两秒。

如果抓取次數不少,但獨立 URL 很少,說明蜘蛛反复在少數頁面上打轉,多半是内部連結或跳轉鏈出了問题。如果 404 和 5xx 占比偏高,抓取资源就被這些無效响應消耗掉了。

最常见的几類抓取浪費

  1. 參數與篩選组合頁。篩選、排序、追踪參數會组合出大量近似 URL,蜘蛛逐條跟進後收益很低。
  2. 翻得很深的分頁。列表翻到几十頁之後内容價值有限,却仍然占用抓取。
  3. 失效但仍有内鏈的地址。下架商品、合並栏目留下的 404 與跳轉鏈,只要内鏈還指向,蜘蛛就會持續回訪。
  4. 重复的 URL 變体。大小寫、參數、末尾斜杠等差异造成的同一内容多地址。
  5. 站内搜尋结果頁與日歷類無限頁面。這類頁面數量理论上没有上限,最容易把抓取吸干。
  6. 大文件與接口地址。体积大的附件、图片原图、返回資料的接口,抓取開销高、收錄價值低。

處理顺序:先堵,再引

調整抓取分配大致分两步。第一步是减少浪費:對没有收錄價值的 URL 用 robots.txt 屏蔽抓取,對篩選參數用 canonical 或 noindex 收敛,把失效地址的入口内鏈清理掉,並让跳轉鏈尽量短。第二步是把抓取引到重要頁面:在首頁、栏目頁、热门内容中给目标頁更多且稳定的内鏈入口,同时保持站点地图與實际連結一致。

也有人會用蜘蛛池去增加抓取机會。這在一段時間内可能让蜘蛛来訪更频繁,但如果站点本身积压了大量低價值 URL,抓取變多也只是把资源摊得更薄,真正需要更新的頁面未必因此受益。

减少浪費之後,別急着要结果

抓取分配的調整需要時間,通常要等蜘蛛重新爬過几轮才能看出變化。而且抓取量提升與收錄量提升是两件事:頁面能否進索引,還要看内容是否獨立、是否满足搜尋需求、有没有被重复内容稀释。抓取通了,只是把门打開。

把抓取日誌当成体检报告,而不是成绩單。它告诉你资源花在了哪里,但不會替你判断頁面的價值。