先理解:抓取预算不是一個開關
很多人把抓取预算理解成搜尋引擎發给每個站点的固定配額,用完就停。實际更像一個動態结果:搜尋引擎會根據站点規模、更新频率、頁面质量、服務器响應和連結结构,估算每天值得来抓多少次、抓哪些地址。它不是你能直接申請的額度,而是站点结构長期表現出来的一種狀態。
所以当收錄不理想时,“多提交几次”往往無效;真正要動的是让蜘蛛在有限時間里少走無效路径,多到目标頁面。
哪些内容在悄悄消耗訪問
- 同一内容的多參數地址:篩選、排序、跟踪參數各生成一份,蜘蛛逐個抓,頁面却高度相似。
- 大規模低價值列表:分頁很深、每頁内容重复度高,抓取量大但很少進入索引。
- 失效與跳轉:大量 404、软 404、多跳重定向,都會占掉請求次數。
- 慢响應:單個頁面响應時間長,同一時間能抓的量自然下降。
- 被 robots 屏蔽却仍被内鏈大量指向的地址:蜘蛛會反复發現、反复放弃。
把頁面分成三档,再决定投入
與其逐個頁面纠结,不如先在站点层面做一次分類。
- 必须被收錄:核心商品、核心文章、栏目主入口。它們應该获得稳定的内鏈入口、較短的点击深度,並在站点地图里單獨列出。
- 可以收錄,但不關键:舊内容、辅助說明頁。保持可訪問,不必刻意加内鏈。
- 不建议收錄:篩選结果、排序頁、重复的分頁副本、空结果頁。用合理方式收敛,而不是放任蜘蛛自由發現。
分類完成後再回头看,很多“收錄不上去”的問题,其實是第一档頁面没能拿到足够的抓取入口。
具体可以做的几件事
1. 收敛重复地址
同一份内容尽量只保留一個規范地址。分頁、篩選參數需要保留的,保證它們指向正确的規范版本;不需要被索引的,用 meta robots 或 robots.txt 控制,但要留意两者的作用范围不同:前者阻止頁面進入索引,後者阻止抓取本身。
2. 减少無效抓取
返回正确的狀態碼、缩短重定向鏈、让失效頁面干脆地返回 404。這些看起来是技術细节,但它們直接决定了蜘蛛的每一次訪問是否“花得值”。
3. 站点地图只放该被收錄的地址
站点地图可以分成若干份,核心頁面單獨一份並保持 lastmod 准确;不要把參數頁、已下架頁面混進去。站点地图的作用是提示,不是保證被收錄。
4. 用内鏈引導
内鏈既是用戶路径,也是蜘蛛路径。把指向核心頁面的連結放在稳定、可爬到的位置,比在頁脚堆几百個連結更有效。
怎么驗證調整有没有效果
不要只看總的收錄數量,可以分几條线看:
- 日誌里蜘蛛訪問的狀態碼分布,404 與 3xx 的比例是否下降。
- 訪問次數在目錄层面的分布,核心目錄是否拿到更多請求。
- 核心頁面的平均抓取間隔是否缩短。
- 站点地图提交的地址與實际被抓取的地址是否接近。
抓取预算的調整属于長期工程,通常要以周為單位观察,單次改動很难立刻看到收錄變化。
最後
收錄是站点结构、内容质量和抓取行為共同作用的结果,不是一個可以强行打開的结果。把蜘蛛有限的訪問留给真正有意义的頁面,剩下的交给時間和持續维護。