讨论收錄时经常绕不開「抓取预算」,但這個词容易被理解成一個固定額度:平台每天分配给某個站点的抓取次數。更准确的说法是,它是抓取行為的结果——在站点响應速度、内容更新频率、URL 總量和歷史抓取表現的综合作用下,爬虫在一段時間内實际回訪了多少次。预算不是一個數字,而是一個观察结论。
抓取预算從哪来,什么站点更需要關心
站点規模越大、URL 越多、响應越慢,抓取被分散带来的影响越明顯。几百個頁面的小站,通常不用太焦虑;而几萬、几十萬 URL 的站点,或者頁面生成方式會产生大量參數组合的站点,才需要認真對待。常见的信号是:日誌里核心頁面的回訪間隔越来越長,新頁面等待被抓的時間變長,同时大量請求落在低價值 URL 上。
常见被浪費的抓取:几類典型入口
- 站内搜尋结果頁:關鍵詞组合近乎無限,绝大多數没有獨立價值,却常被内部連結暴露出来。
- 篩選與排序參數:颜色、價格区間、排序方式等组合,如果没有獨立内容,容易形成大量近似頁面。
- 日歷、無限滚動、輸出格式:日期翻頁、打印頁、導出文件等,往往對用戶和索引都意义有限。
- 已刪除頁面的软 404:返回 200 但内容為空或只提示「已下架」,會被反复抓取。
- 重定向鏈與失效連結:多跳跳轉消耗請求,也可能让目标頁面的信号传递不清楚。
- 分頁過深:列表第 50 頁之後基本無人訪問,但爬虫可能逐頁跟到底。
先取證:用日誌和索引报告對齐事實
- 從服務器日誌按目錄或模板統計抓取次數、狀態碼分布、平均响應時間。
- 把抓取量最高的 URL 路径,和索引报告里「已编入索引」「已排除」的數量對照看。
- 找出抓取占比很高、但几乎不带来訪問和轉化的路径。
- 记錄核心頁面的最近抓取時間與間隔,作為後續复查的基线。
這一步的意义在于避免凭感觉删路径。有些看似無價值的 URL,其實是站内重要的入口或導航,誤屏蔽會连带影响其他頁面的發現。
保哪些:按價值排優先級
優先級不必复杂,通常按业務目标排即可:可直接轉化的頁面、需要及时更新的内容、层級較浅且内鏈充足的頁面排在前面;分頁、聚合、篩選等辅助頁面排在後面,能收敛就收敛。
- 必须抓:核心類目、商品與文章詳情、更新频繁的频道頁。
- 尽量抓:重要列表頁的前若干頁、有獨立價值的聚合頁。
- 可放弃:站内搜尋结果、無效篩選组合、打印與導出頁。
- 需處理:软 404、重定向鏈、重复參數。
提示:robots.txt 屏蔽只能阻止抓取,不能移除已经建立的索引;要让頁面登出索引,通常需要它先可被抓取,再用 noindex 或跳轉来處理。
落地时容易做错的地方
几個常见誤区:一是把 robots.txt 当成刪除索引的工具;二是给重要頁面加了 noindex,同时又用 robots 屏蔽它,導致爬虫看不到這條指令;三是 sitemap 里塞進全站 URL,包括篩選组合,反而扩大了抓取面;四是只做屏蔽不复盘,几個月後參數结构變化,又出現新的浪費。
技術手段按成本從低到高大致是:减少無效内鏈入口、規范 URL 參數、返回正确的狀態碼、必要的 robots 屏蔽、最後才是 noindex。
复查:用同一套指标看變化
調整後不要只看單日資料。用相同口径的日誌統計,观察两到四周:核心頁面的抓取間隔是否缩短、低價值路径的請求是否下降、新頁面首次被抓的時間是否有變化。抓取预算的改善通常表現為抓取分布的變化,而不是總量猛增。
抓取预算管的是把有限請求花在哪里,它會影响發現和更新效率,但不直接等于收錄结果。頁面最终能不能進索引,還是取决于内容本身是否值得、是否可訪問、是否與其他頁面高度重复。