網站收錄

抓取预算怎么分配:收錄慢时先检查這几類 URL

收錄慢的时候,先別急着提交更多 URL。搜尋蜘蛛每天能抓的次數有限,如果大部分落在篩選參數、搜尋结果頁和重定向鏈上,真正想被收錄的頁面只能排在队尾。本文讲怎么從日誌里看清抓取去向,把低價值 URL 挪出蜘蛛路径,再重新安排重要頁面的抓取顺序。

網站收錄

抓取预算怎么分配:收錄慢时先检查這几類 URL

收錄慢,先看蜘蛛把時間花在哪

很多人遇到新頁面迟迟不收錄,第一反應是繼續提交 URL、加外鏈、加内鏈。但如果日誌里搜尋蜘蛛每天都在来,抓的却都不是你想收錄的頁面,那再加提交量,也只是把同样的路径重复走一遍。

搜尋蜘蛛對單個站点的抓取量是有上限的,這個上限受站点規模、更新频率、服務器响應速度和站点整体重要性影响。它不是官方公布的固定配額,而是一種资源分配的结果:同样的抓取次數,花在篩選參數上,就少一次花在詳情頁上。

從日誌里看清抓取去向

把最近一段時間的蜘蛛日誌按目錄、參數和响應碼分组統計,通常能看到非常集中的分布:

  • 带排序、篩選、價格区間的參數頁占了大多數;
  • 站内搜尋结果頁被反复抓取,尤其是把搜尋词拼進 URL 的那種;
  • 按日、按月翻頁的归档頁一层套一层,越翻越深;
  • 同一内容存在打印版、移動版、带 utm 參數的多個副本;
  • 大量 301 鏈條和软 404,蜘蛛每次都要走完整個跳轉;
  • 統計跳轉、外鏈跳轉這類本不该被抓的中間頁。
如果八成抓取都落在這類 URL 上,新頁面排在队尾也就不奇怪了。

把低價值 URL 挪出蜘蛛路径

處理时要区分「不想被抓」和「想抓但不收錄」两種情况:

  1. 不想被抓的:篩選參數、站内搜尋、統計跳轉,用 robots.txt 屏蔽抓取。注意屏蔽抓取不等于阻止收錄,如果這些 URL 已经被外部連結指向,最好连同 noindex 一起處理。
  2. 想抓但不收錄的:重复的打印版、參數副本,用 noindex 或 canonical 归並,让蜘蛛進来一次就拿到明确信号,不必反复回訪。
  3. 该被抓的:把 sitemap 收敛到只放真正需要收錄的 URL,lastmod 寫真實時間,不要每次生成都把所有條目的時間刷新一遍。
  4. 结构性支出:减少重定向层級,重要頁面尽量控制在离首頁三到四次点击以内,内鏈指向詳情頁而不是全部堆在首頁。
  5. 响應速度:TTFB 偏高的頁面抓取频率通常更低,先让重要頁面快起来。

顺序上先做哪一步

優先級可以按确定性来排:先處理明确低價值的參數頁和搜尋结果頁,這類改動通常见效最快;再處理重定向鏈和内鏈结构,属于慢變量;最後才考虑 sitemap 調整和重新提交。改完之後回头看日誌,抓取分布的變化一般比收錄變化来得更早,可以先把抓取分布当作观察指标,而不是只盯着收錄數字。

需要說明的是,把抓取机會让给重要頁面,只是让頁面被看到的概率更高一些。是否最终收錄,仍取决于頁面本身的质量和是否存在對應的搜尋需求。抓取预算管的是机會分配,管不了最後的结果。