先把“抓取预算”這個词拆開
很多站長把抓取预算理解成搜尋引擎每天分配给某個站点的抓取條數,好像一個額度,用完了就等第二天。實际更接近一個结果:搜尋引擎在有限的资源下,根據站点的重要性、更新频率、服務器响應速度,决定在你這里停留多久、抓多少個 URL。所以它不是可以申請或調高的數值,而是站点自身條件算出来的结果。
理解這一点,很多現象就顺了:同一個站,内容没怎么變,抓取量却下降,通常不是被扣了額度,而是同一時間有別的站点、別的頁面更值得抓。
蜘蛛的時間通常花在哪几類頁面上
重复的 URL 组合
篩選、排序、分頁、跟踪參數,如果都能返回 200 且内容高度相似,每一個组合都可能被当成一個新地址抓一次。理论上几千個頁面,實际可能生成几萬個可抓 URL。
低價值頁面和软 404
空搜尋结果頁、没有内容的标簽頁、返回 200 但正文為空的頁面,會持續消耗抓取時間,却不带来索引價值。
入口很深的頁面
需要点五六层才能到達的頁面,被發現的机會本来就少,抓取優先級也低。站点越大,這個問题越明顯。
把抓取時間引到重要頁面的做法
- 收敛 URL:對參數頁面做统一處理,用 canonical、robots 或合适的狀態碼收口,別让同一份内容有几十個入口。
- 内鏈指向要抓的頁面:栏目頁、聚合頁、正文之間的相關連結,是蜘蛛走路的路径。把重要頁面放在离首頁更近的位置。
- 保持 sitemap 干净:只放需要收錄的規范地址,及时删掉已下线的 URL,不要把所有參數地址都塞進去。
- 處理软 404 和空頁面:没有内容就返回 404 或 410,或者把内容补齐,別让它一直以 200 狀態挂着。
- 保證响應速度:服務器慢,蜘蛛抓一個頁面要等很久,單位時間能抓的數量自然變少。
观察:日誌和抓取統計比猜测可靠
服務器日誌能看到蜘蛛每天来了多少次、抓了哪些地址、返回什么狀態碼;搜尋後台的抓取統計能看到抓取請求總量和响應情况。把两邊對照,很容易發現是哪一類 URL 在吃掉大量請求。
如果日誌里出現大量參數頁、分頁、空頁面被抓,而正文頁抓得很少,問题多半出在站点结构和 URL 管理上,而不是別的站点抢走了机會。
几個容易搞反的地方
- 抓取多不等于收錄多。抓取只是把頁面拿回去看,收不收還要看内容质量和重复判断,前者只是後者的前置條件。
- 提交 sitemap 不等于優先抓取。它主要帮助發現 URL,並不會改變抓取優先級顺序。
- 靠外部批量制造入口意义有限。人為堆出来的連結如果指向低质量頁面,只會让抓取時間花在更不值得的地方,對收錄没有實质帮助。
- 抓取量短期波動很正常。看趋势比看單日數字更有參考價值。
说到底,抓取预算的改善来自站点本身:URL 更干净、结构更清楚、重要頁面更容易被找到。這三件事做到位,抓取時間自然會往该去的地方走,收錄效率也會跟着變化。