站点做到几百上千個 URL 之後,很容易遇到一種情况:日誌里蜘蛛来得很勤,但抓的多是篩選頁、排序頁、站内搜尋结果頁;真正想被發現的栏目頁和詳情頁反而迟迟没人訪問。這通常不是蜘蛛偷懒,而是站点的入口把抓取配額引到了低價值的地方。
先分清抓取和收錄
被抓取,只說明蜘蛛把 URL 取回去看過一次;被收錄,是搜尋引擎判断這個頁面值得放進索引。两者之間隔着内容质量、重复度、站内上下文好几道判断。所以抓取配額要解决的問题是:让蜘蛛把有限的訪問次數花在值得被判断的頁面上,而不是保證某個頁面一定進索引。
先看清楚配額被谁消耗了
打開服務器日誌,按目錄或 URL 特征分组統計蜘蛛的訪問次數,通常能找出几個吃配額大戶:
- 带參數的篩選、排序、價格区間連結,组合起来數量可以無限膨胀;
- 站内搜尋结果頁,被蜘蛛顺着表單或連結抓到;
- 翻頁過深的列表頁,第 30 頁以後基本没有獨立價值;
- 同一内容的不同版本:打印頁、分享頁、移動參數版;
- 批量生成的标簽頁、作者归档頁,往往只有标题列表。
按頁面價值给 URL 分級
分級不需要很复杂,按是否有獨立内容、是否有人愿意点進来判断即可:
- 一級:栏目頁、专题頁、核心詳情頁,是抓取優先保障對象;
- 二級:有實际内容的文章、常见問题頁、必要的分頁;
- 三級:篩選、排序、标簽、作者归档,允许被抓但不必主動推;
- 四級:站内搜尋、空结果頁、測試頁、後台残留頁面,尽量不让蜘蛛進入。
用内鏈把優先級传出去
蜘蛛主要靠連結找路,内鏈的位置和數量就是你给出的優先級信号。
- 一級頁面尽量從首頁或栏目頁用少量高相關文字連結直達,別埋在四五层之下;
- 三級頁面不要在每個頁面底部铺全量連結,那會稀释一級頁面的入口;
- 分頁保留可以点開的形式,慎用加载更多把所有结果塞進一個頁面;
- 四級頁面優先用站内規則拦住,比如 robots 元标簽或 robots.txt。
注意 noindex 和 robots.txt 的分工:被 robots.txt 拦住的頁面,蜘蛛讀不到 noindex,所以两者混用常常出現明明设了 noindex、索引里却還在的情况。需要 noindex 生效,頁面就得允许被抓取。
减少重复 URL 造成的浪費
同一份内容對應多個 URL,會让抓取配額白花好几份。可以按這個顺序處理:先统一协议、大小寫、尾斜杠這類規范寫法;再用 canonical 指定主版本;投放用的追踪參數只用于外部渠道,不進入站内連結。
調整之後怎么驗證
改完不要立刻下结论,观察两到四周:目标目錄的抓取次數占比是否上升、狀態碼里 200 的比例是否提高、被抓取較多的頁面是否開始出現收錄變化。一次改太多,反而分不清哪一步起了作用。
常见誤区
- 以為抓取次數越多收錄就越快,其實方向错了再频繁也無效;
- 一次性把成千上萬個 URL 推给搜尋引擎,注意力被摊薄;
- 長期放任蜘蛛抓篩選頁,核心頁面迟迟得不到訪問;
- 只盯着提交動作,不看日誌里蜘蛛實际去了哪里。
抓取配額的管理,本质是把站点的结构、内鏈和參數規則整理清楚,让蜘蛛少走弯路。它不承诺收錄,但能让真正有價值的頁面更早進入被判断的队列。