不少站長看服務器日誌,會發現搜尋蜘蛛每天来得不少,抓取次數也稳定,但索引量就是不動。這时候容易怀疑蜘蛛池质量、怀疑站点被降權,却忽略了一個更常见的原因:蜘蛛的時間被大量無效 URL 消耗掉了。
搜尋引擎對每個站点的抓取资源是有限的。它愿意来,不代表會無限制地抓。当站内出現大量參數组合、重复頁面、失效地址和低價值入口时,抓取预算會被快速摊薄,真正需要收錄的内容反而排不上队。
先区分:抓取频次與收錄结果不是一回事
抓取是蜘蛛来讀取頁面,收錄是搜尋引擎判断這個頁面值得進入索引。抓取多,只能說明蜘蛛愿意来;收錄少,說明它在讀取之後認為頁面價值不够,或者同類頁面已经太多。
如果日誌里某個路径被抓了几千次,索引里却只有一两條,這個路径通常就是抓取预算的消耗大戶。
哪些 URL 最容易吃掉抓取预算
- 參數组合頁:篩選、排序、颜色、尺碼、價格区間,每個组合都能生成新地址,蜘蛛顺着連結就會一路抓下去。
- 會话 ID 與跟踪參數:同一篇文章因為分享連結带上不同參數,被当成多個地址反复抓取。
- 無限分頁與日歷归档:分頁一直翻不到头,日期归档每月每天一個地址,内容却高度重复。
- 失效連結與重定向鏈:站内大量死鏈、跳轉鏈,蜘蛛每次都要花時間確認最终地址。
- 低质聚合頁:标簽頁、作者頁、搜尋结果頁,只罗列标题没有獨特内容,却被站内連結大量指向。
這些 URL 不一定都是错誤,但如果它們占據了抓取日誌的大部分,有效頁面的抓取机會就會被挤压。
核對顺序:從日誌到索引
- 導出高频抓取路径:按目錄或參數维度統計,找出抓取次數最多但索引量為零或极低的地址模式。
- 标记頁面角色:哪些是内容頁,哪些是功能頁,哪些只是導航或篩選结果。内容頁優先保留,功能頁考虑收敛。
- 检查入口連結:很多無效 URL 不是蜘蛛自己猜出来的,而是站内連結主動喂给它的。列表頁、面包屑、相關推荐都可能是入口。
- 選擇收敛方式:能用 robots.txt 屏蔽的目錄先屏蔽;不能屏蔽的頁面用 canonical 指向主版本;纯導航連結可考虑 nofollow;有效内容頁則保留在站点地图里。
- 观察抓取與索引變化:處理之後不要只看一两天。抓取路径结构變化通常需要一到數周,索引量才會跟着調整。
几種常见誤判
把抓取量当成收錄量
日誌里抓取次數上涨,可能是蜘蛛在反复抓同一批參數頁,並不代表新頁面被收錄。要分開看抓取日誌和索引狀態报告。
屏蔽過度,把内容頁也挡了
為了减少抓取,有人直接屏蔽整個目錄,结果把需要收錄的詳情頁也挡在外面。屏蔽前先確認目錄下有没有真正的内容頁。
只靠 robots.txt,不做站内收敛
robots.txt 只是不让抓,站内連結仍然存在,蜘蛛仍可能通過其他路径發現這些地址。更稳妥的做法是同时减少入口連結和參數生成。
抓取预算不是越多越好,而是越集中越好。让蜘蛛把有限的時間花在值得收錄的頁面上,比單纯追求抓取次數更有意义。
把抓取留给有效頁面
如果蜘蛛来得勤、收錄却不涨,可以先從日誌里找“抓取多、收錄少”的路径,再按“分類頁面角色—收拢入口—設定規范—观察索引”的顺序處理。不要指望一次調整立刻见效,但持續把無效 URL 從抓取路径里拿掉,有效頁面的抓取和收錄机會會逐步回升。