很多人把收錄慢归到“權重不够”,但打開日誌往往會看到另一幅画面:蜘蛛确實来了,只是把大部分請求花在了没有收錄價值的地方。抓取配額(也常被叫做抓取预算)说的就是這件事——搜尋引擎愿意在你的站上投多少抓取請求,以及你的服務器能稳定接住多少。
抓取配額不是開關,而是一種分配
它没有可以查询的固定數值,更像一種動態權衡:搜尋引擎根據站点体量、更新频率、响應速度和歷史表現,决定用多少资源来抓。站点响應越快、URL 越干净、重复越少,同样的资源就能覆盖更多有效頁面。反過来,如果大量請求都落在同一批無價值的 URL 上,真正需要被發現的新頁面就排到了後面。
所以下面這些問题,通常不會同时出現,而是先在某几個目錄里集中暴露。
常见被浪費掉的几類 URL
- 參數组合頁:篩選、排序、會话 id、跟踪參數互相叠加,理论组合几乎無穷。
- 重复入口:同一條内容有带 www / 不带 www、带斜杠 / 不带斜杠、大小寫不同的多個版本。
- 失效地址:已经下线但站内還留着連結的舊頁面,蜘蛛每次来都要吃一次 404 或软 404。
- 重定向鏈:A 跳 B、B 跳 C,一次抓取消耗三次請求,中途還可能断掉。
- 無意义分頁:日歷頁、翻到很後面的列表頁,几乎没有被訪問的可能。
- 慢响應頁面:單個頁面响應時間過長,會直接压缩這一轮能抓的數量。
做一次低成本的日誌盘点
- 取最近 7 天以上的抓取日誌,按目錄或 URL 類型分组,而不是逐條看。
- 統計每组的狀態碼分布:200、301、404、5xx 各占多少。
- 看响應時間的分布,找出拖後腿的頁面或接口。
- 把命中量最高的前几组 URL,拿去和導航、sitemap、内鏈對照,看它們是不是真的需要被收錄。
- 對照之後通常會發現,浪費集中在少數几類路径上,處理其中一两類就能看到變化。
服務器這一侧也在决定上限
抓取配額再充足,如果服務器经常超时、返回 5xx,或者安全策略把正常蜘蛛也拦掉了,請求照样進不来。這部分的排查顺序一般是:先確認蜘蛛拿到的是正常 HTML 而不是拦截頁,再看响應時間是否稳定,最後才去讨论内容质量。反過来,一味追求抓取频率而不解决超时,只會让更多請求失敗。
减少浪費的常規動作
- 用 robots.txt 挡住明确的參數路径或功能路径,但別顺手挡住需要收錄的正文。
- 用 canonical 归並重复入口,同时保證内鏈指向規范版本。
- 清理失效内鏈,把舊地址的重定向收敛成一次跳轉。
- sitemap 只放規范 URL,不要把各種變体都塞進去。
- 對确實需要保留但不需要收錄的頁面,用合适的 noindex,而不是让它長期占着抓取。
別把配額当成收錄保證
改善抓取分配,能让有效頁面更容易被抓到,但它不保證一定進入索引。索引還取决于頁面本身的内容、與站内其他頁面的關系,以及是否有重复版本在相互竞争。抓取是入口,收錄是结果,中間還隔着頁面质量這一關。
一個實用的判断标准:如果日誌里蜘蛛来得不少,但命中最多的一批 URL 你並不希望被收錄,那問题多半出在配額分配上,而不是“蜘蛛不来”。
調整时建议一次只改一處,改完观察两到四周的日誌和索引變化,再决定下一步。几處改動同时叠加,出了問题會很难判断是哪一步起的作用。