很多站長看抓取日誌时,只關注蜘蛛有没有来。但更值得看的是:蜘蛛把時間花在了哪些 URL 上。抓取资源不是無限供應,如果大量低價值 URL 被频繁抓取,真正希望被收錄的頁面就會排得更靠後。
抓取预算不是固定配額,但會被分摊
搜尋引擎没有公開一個固定數值的“抓取预算”,但抓取频率确實受站点規模、更新频率、服務器响應速度、頁面质量等因素影响。可以把它理解成一種動態分配:蜘蛛愿意给這個站多少抓取机會,以及這些机會怎么分。低價值 URL 拿得越多,有效頁面拿到的就越少。
從日誌里找出高频消耗項
先按蜘蛛 UA 過滤日誌,再按 URL 聚合請求次數、狀態碼和平均响應時間。重点看那些被抓取很多、但從未带来搜尋流量的路径。
- 分頁連結:page/2 之後的頁面如果内容重复,通常不值得反复抓取。
- 篩選和排序參數:?color=red&size=m 這類组合容易生成大量相似 URL。
- 标簽和聚合頁:内容稀薄、互相重复时,會持續消耗抓取。
- 站内搜尋结果頁:參數化 URL 大多没有獨立收錄價值。
- 會话 ID 和追踪參數:同一頁面出現多個 URL 版本。
- 404 和重定向鏈:蜘蛛反复訪問舊連結,會占用抓取机會。
- sitemap 中的低價值 URL:主動提交等于主動引導抓取。
判断低價值的两個标准
一是這個 URL 有没有獨立的搜尋需求;二是它與其他頁面是否高度重复。两者都不满足时,通常不值得占用抓取资源。
收敛顺序:先堵入口,再清 sitemap
- 内部連結:先移除或减少指向低價值 URL 的入口,尤其是全站導航和頁脚。
- robots.txt:對确定不收錄的目錄或參數做 disallow,注意不要誤封需要抓取的 CSS、JS 和图片。
- canonical:對保留但重复的頁面,指向主版本,帮助搜尋引擎合並信号。
- sitemap:只保留希望被收錄的 URL,移除參數頁、聚合頁和已失效連結。
- 服務器端:對確認無價值的 URL 返回 410,或 301 到相關的主頁面,减少反复抓取。
顺序有讲究。只清 sitemap 但内部連結還在大量輸出,蜘蛛仍會從別處發現這些 URL。只做 robots 而不清理服務器响應,已發現的 URL 也可能繼續产生抓取請求。
收敛後观察什么
观察日誌中目标頁面的抓取频次、狀態碼和首次發現時間。不要期待調整後立刻收錄,抓取和索引更新都需要周期。同时检查目标頁面是否响應過慢,服務器延迟本身也會影响抓取频率。
抓取優化的目标不是让蜘蛛来得更多,而是让蜘蛛把時間花在真正希望被收錄的 URL 上。
常见誤区
- 用 robots 一刀切屏蔽所有參數,结果誤伤正常頁面。
- 只清理 sitemap,内部連結和導航仍在輸出低價值 URL。
- 把抓取量当成收錄量,忽略頁面质量和重复内容問题。
- 反复提交低價值 URL,以為能加速收錄,反而挤占有效抓取。
先從日誌里找出消耗抓取最多的那几類 URL,再决定收敛顺序。每次只改一两項,观察一個周期後再調整,比一次性大規模屏蔽更稳妥。