搜尋抓取

抓取预算的去向:蜘蛛把時間花在哪類 URL 上

蜘蛛的抓取量是一種有限资源。本文從抓取预算分配的角度,梳理哪些 URL 容易吃掉配額、如何通過内鏈與 Sitemap 把抓取引導到核心頁面,並给出用日誌做抓取盘点的简單方法。

搜尋抓取

抓取预算的去向:蜘蛛把時間花在哪類 URL 上

很多站点运营者會問:蜘蛛一天到底能抓多少頁面?這個數字並不固定,它和站点規模、服務器响應速度、内容更新节奏都有關系。更實际的問题不是“能抓多少”,而是“抓到的這些 URL 里,有多少是你真正希望被處理的”。把抓取量当成一種有限资源来分配,比單纯追求抓取次數更有意义。

抓取预算是怎么被分配的

搜尋引擎不會提前告诉你配額,但從日誌里能观察到大致規律:蜘蛛會按 URL “值得再来看一眼”的程度,安排訪問顺序。影响這個判断的因素通常包括:

  • 這個 URL 之前是否返回過 200,内容是否有變化;
  • 它被站内連結指向的次數和位置;
  • 站点整体的更新节奏與歷史响應质量;
  • Sitemap 中是否列出了它,以及 lastmod 是否合理。

這些信号叠加在一起,决定了蜘蛛先抓谁、多久回来看一次。它們不是權重公式,而是一组经驗性的倾向。

哪些 URL 容易悄悄吃掉抓取量

參數與篩選组合頁

颜色、排序、每頁條數、追踪參數……同一批商品可以生成几十上百個地址。蜘蛛發現它們不难,难的是它要花時間逐個確認這些頁面是不是新内容。多數情况下,它們只是在消耗配額。

無限翻頁與日歷归档

一個可以一直点下去的“下一頁”,或者按日期生成的归档頁,數量會随時間线性增長。如果没有给蜘蛛一個明确的终止信号,它會一直顺着走。

大量近似重复的地址

带 www 與不带、带尾斜杠與不带、大小寫混用,這些技術层面的重复,會让同一份内容以多個 URL 的身份反复被請求。用規范标簽或 301 收敛,能省下不少無谓的抓取。

把抓取量引回有價值的頁面

  1. 让重要頁面在点击距离上更近,首頁或栏目頁直接给出入口。
  2. 用内鏈把發現路径集中到少數核心 URL 上,而不是每個頁面平均分配。
  3. 對低價值组合頁做收敛:能合並的合並,不能合並的用 robots 或參數處理規則挡掉。
  4. 给翻頁設定合理上限,並在列表頁上给出清晰的分類入口。
  5. Sitemap 只放希望被抓的地址,別把全站 URL 一股脑塞進去。

服務器响應也在影响抓取节奏

蜘蛛的抓取速度和服務器狀態是互相影响的。响應慢、超时多,蜘蛛通常會主動降速,避免给站点造成压力,但代價是單位時間内能抓的 URL 變少。反過来,稳定快速的响應會让它在同样時間里多走一些頁面。

需要留意的是:抓取频次上升不等于收錄增加。如果被抓的仍然是一批無價值的參數頁,那只是把资源花在了同一個地方。

做一次简單的抓取盘点

從服務器日誌里筛出蜘蛛的訪問记錄,按 URL 分组統計請求次數,然後回答三個問题:請求最多的前 100 個 URL 里,有多少是你希望被收錄的?哪些栏目頁被反复抓但内容几乎没變?哪些新發布的頁面在一周内一次都没被訪問?

答案往往能直接指出問题所在:要么内鏈没给到新頁面,要么低價值 URL 抢走了注意力。調整之後再看一段時間的日誌,观察抓取分布是否發生迁移,比盯着單日的抓取總量更有參考價值。