很多人盯着收錄數看,却忽略了一個前置問题:蜘蛛總共在你站上花多少時間、抓多少個 URL。搜尋引擎的资源不是無限的,它會给每個站点分配一個大致的抓取額度,這個額度通常被叫做抓取预算。预算被無關紧要的頁面占满,真正需要收錄的頁面就可能排不上队。
抓取预算不是固定配額,而是動態取舍
需要先說明的是,抓取预算没有公開的固定數字,也没有哪個工具能直接告诉你今天分到了多少。它是搜尋引擎根據站点規模、更新频率、响應速度、頁面质量等信号综合判断的结果。站点表現好,抓取频率可能提高;問题頁面多、响應慢,蜘蛛可能来得更少。
所以讨论预算时,重点不是把額度做大,而是現有的抓取次數是不是花在了该花的地方。
预算常被哪些頁面吃掉
- 參數與篩選頁:排序、篩選、追踪參數會组合出大量地址,蜘蛛顺着内鏈走一遍就消耗可观。
- 列表的深层翻頁:翻到几十頁之後的列表,對用戶價值有限,却容易被反复抓取。
- 软 404 與空结果頁:返回 200 但内容為空,蜘蛛無法判断该不该放弃,容易反复回訪。
- 大量重定向:每跳一次都是一次請求,鏈式跳轉更浪費。
- 站内搜尋、日歷、打印頁等生成型地址:數量近乎無限,是最典型的预算消耗点。
先看日誌,再决定收口
判断预算去向,最直接的材料是服務器日誌。可以按這几個维度切分:
- 抓取频次最高的目錄和 URL 模板,是不是重要内容?
- 狀態碼分布里,3xx、4xx、5xx 各占多少?異常比例高,說明抓取在浪費。
- 同一個 URL 被重复抓取的次數,是否遠超它實际的更新频率?
- 重要頁面(新品、核心栏目)的抓取間隔,是否明顯長于低價值頁面?
看完這些,通常能發現预算被少數几類頁面牵着走。
把抓取留给重要頁面
- 收敛參數:能合並的篩選、排序參數尽量合並,或让這類頁面不要被内鏈大量指向。
- 處理無價值地址:空结果頁、站内搜尋结果頁,可以考虑用 noindex 或 robots 規則挡掉;注意 robots 挡住後頁面上的 noindex 也就讀不到了,两者要配合使用。
- 修好错誤頁面:该 404 的返回 404,该 301 的一次跳到位,避免软 404 和重定向鏈。
- 提高响應速度:响應慢會直接拉低單位時間内的抓取量。
- 内鏈指向重点:把站内連結和 sitemap 集中到真正希望被索引的 URL 上。
抓取预算優化的是抓取效率,它能让重要頁面更快被發現、更频繁地被重訪,但抓取次數多不等于就會被收錄,最终還要看頁面本身的内容與质量。
別把這套当成速成手段
抓取预算是一個長期變量,調整後往往需要几周甚至更久才能在日誌里看到變化。比較稳妥的做法是:先清理明顯浪費抓取的地址,再观察重要頁面的抓取間隔有没有改善,而不是短期内反复改動站点结构。收錄是结果,抓取是過程,把過程理顺,结果才有讨论的基础。