抓取预算不是一份固定配額
很多站長把抓取预算理解成搜尋引擎每天给的一個固定數字,其實更接近两股力量的平衡:一邊是站点能承受多快的抓取速度,另一邊是搜尋引擎認為有多少 URL 值得来抓。前者受服務器性能、响應時間影响,後者受站点規模、内容更新频率和内部連結结构影响。站点越小,這件事越不需要操心;当 URL 數量到几萬甚至几十萬,尤其是站内有大量參數、篩選和搜尋结果頁时,就值得認真看一看了。
需要說明的是,抓取预算宽裕並不會直接带来排名,它只是让重要頁面更快被發現、更快被重新抓取的一個前提條件。
哪些站点更该關注這件事
- URL 數量庞大,且由程序自動生成(电商、分類信息、论坛、聚合類站点)
- 單次抓取會触發資料库重查询、响應明顯變慢的站点
- 每天發布大量内容,但新頁面被抓取的時間越来越晚
- 站内搜尋结果頁、篩選頁、排序頁可以被外部直接訪問
如果站点只有几百個頁面,且更新节奏平稳,通常不需要专门優化抓取预算,把精力放在内容质量和基础结构上更划算。
從哪里看出抓取被浪費了
服務器訪問日誌
這是最直接的一手資料。按 user-agent 過滤出蜘蛛的請求,然後看三件事:每天請求總量、狀態碼分布、被請求次數最多的路径。如果排在前面的全是參數頁、搜尋结果頁或者已经下线的舊地址,說明抓取确實被消耗在了低價值的地方。
抓取統計與索引狀態
搜尋引擎後台一般會提供抓取請求數和抓取频次的資料,可以和你自己的日誌互相印證。另外可以观察一個更直观的信号:新發布的内容通常要多久才第一次被抓到,這個時間如果在變長,就值得往下查。
内鏈指向
蜘蛛走的是連結。如果首頁、栏目頁到處都鏈向篩選组合頁,那它自然會往那個方向跑。抓取問题往往先是内鏈問题。
常见的抓取浪費與處理思路
- 站内搜尋结果頁。组合近乎無限,绝大多數没有獨立检索需求,通常是抓取浪費的大头。
- 篩選與排序參數。颜色、價格区間、排序方式等组合出来的地址,内容高度相似。
- 层級過深的分頁。用戶很少翻到很後面,蜘蛛却會一路跟下去。
- 薄内容的标簽頁和聚合頁。只有几條内容却單獨成頁,容易既無價值又占抓取。
- 空列表與软错誤頁。没有结果却返回 200,蜘蛛會当成正常内容反复来訪。
- 會话 ID、跟踪參數。同一個頁面被拆成大量不同地址。
- 打印頁、分享頁、临时预览地址。功能頁通常不需要被抓取。
處理方式無非几種:能合並的合並,没有獨立價值的加 noindex,完全不需要被訪問的直接在 robots.txt 里拦掉,同时把内鏈從這些頁面上收回来,让連結集中指向真正重要的内容。
robots.txt 屏蔽與 noindex 的取舍
這两者容易用混。简單说:不希望蜘蛛抓取、也不介意它是否收錄的地址,用 robots.txt 屏蔽更省资源;希望它抓取但不要收錄的頁面,用 noindex。
如果先用 robots.txt 屏蔽了某個目錄,蜘蛛就看不到頁面里的 noindex 标簽,那個标簽也就不會生效。反過来,如果頁面已经被收錄,只加 robots.txt 屏蔽並不會让它從索引里消失。
所以站内搜尋頁這類既没必要收錄、也没必要抓取的地址,直接屏蔽通常更干脆;而某些需要保留訪問入口、但不希望出現在结果里的頁面,才适合用 noindex。
一份可以照着做的自查清單
- 導出最近一周的蜘蛛請求日誌,按路径統計請求次數排名。
- 标出其中的參數頁、搜尋頁、分頁深水区和已下线地址。
- 確認這些地址是否有獨立检索價值或轉化價值,没有就列入處理清單。
- 检查 Sitemap 是否只包含希望被收錄的規范地址,避免把低價值頁一並提交。
- 检查首頁和栏目頁的内鏈,是否给了低價值頁面過多入口。
- 處理完两周後再看一次日誌,對比請求分布是否變化。
抓取预算本质上不是一個可以單獨優化的指标,它更像是站点结构清晰、内容有價值的副产品。與其一次性做大改,不如把日誌养成定期查看的习惯,發現浪費就随手處理掉。