很多站長把注意力放在“蜘蛛来没来”,却很少問另一個問题:蜘蛛来了之後,把時間花在哪了。對于 URL 數量不多的站点,這個問题影响不大;但当成千上萬的地址同时存在时,抓取预算的分配方式,就會直接决定重要頁面多久被看一次。
抓取预算是什么,又不是什么
抓取预算可以粗略理解為:搜尋引擎在一段時間内,愿意花在你這個站点上的抓取總量。它不是搜尋引擎公開给出的固定數字,也不存在“每天必须抓 N 個頁面”的承诺。它更像一個動態结果,受站点規模、歷史抓取质量、服務器响應速度、頁面更新频率等因素影响。
需要说清楚的是:抓取预算影响的是抓取,不是收錄,更不是排名。把预算花對了,只意味着蜘蛛更有机會看到你希望它看到的地址。
哪些頁面在悄悄消耗预算
低價值 URL 通常不是“坏頁面”,而是重复、易變、缺少獨立價值的地址。常见几類:
- 篩選、排序、视图切換等參數组合产生的成批 URL,内容高度相似;
- 带會话 ID、跟踪參數、時間戳的動態地址,每次訪問都生成新 URL;
- 分頁翻到很後面的列表頁,以及“没有结果”的空列表;
- 重定向鏈較長,或者返回 200 但正文几乎為空的頁面;
- 由前端脚本批量渲染出来的連結,蜘蛛顺着走容易進入大量無意义分支。
這些地址被反复抓取,真正需要更新的詳情頁、栏目頁就會被往後排。
把预算往前排的几個動作
用内鏈把入口收窄
蜘蛛在站内的主要路径来自連結。導航、栏目、相關推荐、面包屑這些位置,尽量只指向有獨立價值的頁面。對于參數组合頁,可以通過 canonical 指向主版本,或者在頁面里减少對外輸出這類連結。
Sitemap 只放你希望被抓的地址
Sitemap 不是“URL 全集”,它更像一份推荐清單。把重复參數頁、空结果頁、已经下线的舊地址放進去,等于主動邀請蜘蛛去消耗预算。分片时也按内容類型或更新频率来切,比單纯按數量切更好管理。
robots.txt 與 noindex 用在该用的地方
robots.txt 阻止的是抓取,noindex 影响的是索引。對大量重复、且不需要被搜尋到的路径,可以用 robots.txt 减少抓取;但要记住,被 robots 拦下的頁面,蜘蛛也看不到上面的 noindex 指令,两者不要混用在同一批 URL 上。
响應速度與稳定性
服務器越慢,單位時間内能抓的頁面越少,這是最直接的预算消耗。TTFB 波動大、频繁出現 5xx 或超时,會让蜘蛛主動降低抓取频次。相比各種技巧,把响應時間压稳,往往收益更直接。
也要知道什么时候不必纠结
抓取预算是規模問题。一個只有几百個頁面的站点,蜘蛛通常能覆盖到大部分地址,過度優化反而容易把正常頁面挡在门外。先確認核心頁面能被抓、能返回稳定内容,再考虑预算分配。
判断标准很简單:如果日誌里大量抓取都落在重复參數頁、空頁和重定向上,而詳情頁几天才被訪問一次,那就說明预算分配出了問题。
用抓取日誌驗證效果
調整之後不用急着下结论。隔一段時間看抓取日誌,观察几個比例:有效内容頁占全部抓取的比例、5xx 與 404 的數量、重定向命中的次數、核心目錄被訪問的频次。比例往好的方向變化,說明预算确實在往有用的地方走。