很多站長會問:蜘蛛一天到底来訪多少次?這個數字没有统一答案,搜尋引擎也不會公開。但有一個更實用的思路:把蜘蛛每一次成功抓取都当成一次成本,看它被花在了哪些 URL 上。消耗得越多、回报越低的頁面,就越值得收敛。
抓取配額不是一個固定數字
搜尋引擎的抓取能力受限于自身基础设施,也受限于你的服務器。它通常會在三類信号之間做平衡:
- 站点容量:服務器响應速度、错誤率、是否频繁超时。
- 抓取需求:站点更新频率、Sitemap 與内鏈暴露出的 URL 數量。
- 頁面價值:外鏈、歷史点击、内容是否長期不變。
所以“配額”不是每天固定發多少張票,而是一個動態结果。服務器越稳、反馈越明确,蜘蛛越愿意多来;如果它總是撞上超时和重复内容,来一趟的意愿就會下降。
配額容易被吃掉的几類 URL
參數與排序副本
篩選、排序、追踪參數會生成大量内容相近的頁面。蜘蛛顺着連結一路抓下去,可能把大部分訪問用在几乎相同的列表上。處理时可以優先保留一到两種參數组合,其余用 canonical 或 robots 規則收敛。
會话语义和临时連結
URL 里带會话 ID、時間戳、随机 token,會让蜘蛛每次都当成新頁面。這類連結應尽量不寫進正文内鏈,也不要交给 Sitemap。
狀態碼混乱的頁面
空结果頁返回 200、下架商品返回 200、错誤頁也返回 200,都會让蜘蛛反复回訪同一批無價值 URL。這類頁面该 404 就 404,该 410 就 410,不要用 200 掩盖。
深分頁與归档
翻到几十頁以後的列表,單頁價值低但數量巨大。可以限制可翻頁范围,归档頁只保留按時間聚合的入口,减少蜘蛛在尾部停留。
自查:從日誌里看配額去了哪
把最近一周的日誌按目錄或 URL 前缀聚合,重点看三個數:
- 每個目錄被抓取的總次數,以及其中返回 200 的比例。
- 响應時間的分布,慢的目錄往往會让蜘蛛提前收手。
- 被抓取最多的 URL 是否包含你並不關心的參數頁或空结果頁。
如果某一類 URL 抓取量很大、内容却几乎不變,基本可以判定是配額浪費点。
抓取量下降时,先別急着加外鏈,先確認蜘蛛是不是把訪問次數花在了重复和無效的頁面上。
把配額引導到關键 URL 的几個動作
- 内鏈指向規范頁:正文里只鏈主版本 URL,不要同时给出带參數的副本。
- Sitemap 只放主 URL:把希望被抓的頁面寫清楚,不要把所有參數组合都塞進去。
- 加快首字节响應:减少重定向鏈、避免同步外部請求,让重要目錄稳定在合理耗时内。
- 更新即暴露:新内容發布後,從首頁或栏目頁给它一個可点击入口,比只放 Sitemap 更容易被走到。
- 区分该抓和不该抓:该抓的保證可訪問、可渲染;不该抓的用明确規則挡住,而不是靠运气。
用一段時間观察,而不是一天
抓取行為有波動,單日資料說明不了太多。調整規則後,观察两到四周的抓取分布是否變化:重要目錄的 200 抓取是否上升,參數頁是否下降,错誤率是否收敛。只要方向對,就繼續;没變化,再回到日誌里找原因。
配額管理的目标不是让蜘蛛来得更勤,而是让每一次来訪都落在會變化、有價值的 URL 上。