很多站長看日誌时會有一種直觉:蜘蛛来得越勤,頁面就越快收錄。實际观察一段時間會發現,抓取频次和收錄數量並不總是同步。有的站点日誌里蜘蛛活跃,索引量却長期停在某個數字;也有的頁面被反复抓取,狀態一直是“已抓取,未编入索引”。要解释這個現象,得把抓取和收錄拆開看,再往下看抓取预算花在了哪里。
抓取和收錄是两道不同的關
抓取是蜘蛛把 URL 下载下来,看 HTML、狀態碼、渲染後的内容。收錄是搜尋引擎在抓取之後,判断這個頁面是否值得放進索引,以及以什么形式放進索引。抓取成功只是拿到了“考试资格”,不代表一定被收錄。頁面质量、重复度、内容價值、站点整体信任度都會參與判断。所以看到蜘蛛频繁来訪,只能說明 URL 被發現了、服務器响應正常,不能直接推出“很快會收錄”。
抓取预算被什么占用
搜尋引擎不會對每個站点無限抓取。站点的抓取频次受權重、更新频率、响應速度、URL 數量等因素影响。如果站内存在大量低價值或重复 URL,蜘蛛的抓取額度會被這些地址消耗,真正需要被收錄的頁面反而排不上队。常见的占用来源包括:
- 篩選參數、排序參數、追踪參數生成的组合 URL;
- 分頁很深、内容重复的列表頁;
- 已失效但仍被内鏈指向的舊地址;
- 同一内容的正反斜杠、大小寫、www 與非 www 版本;
- 由 JavaScript 或接口批量生成、没有實质内容的頁面。
這些頁面被抓取时,往往返回 200 狀態碼,内容却和主頁面高度相似。蜘蛛花時間抓了,判定為重复或低價值,不收錄,但抓取记錄已经产生。下一次它可能還會来,因為連結還在。
抓取频次高但不收錄的几種常见情况
1. 頁面被判定為重复
同一篇内容有多個 URL 可訪問,蜘蛛可能每個都抓,但只選一個進索引。其他版本即使被抓多次,也長期不收錄。這时需要检查 canonical 是否指向正确版本,内鏈是否统一指向主 URL,站点地图里是否混入了非主版本。
2. 頁面内容太薄或缺少獨立價值
如果頁面只是聚合了少量文字、几張图,或者主体内容需要用戶交互後才出現,蜘蛛渲染後拿到的有效信息有限,收錄判断就會保守。功能頁、過渡頁、占位頁尤其容易卡在這里。
3. 站点整体可抓取 URL 太多,權重分散
新站或權重不高的站点,抓取预算本来就有限。如果一次性放出大量新 URL,蜘蛛會先去抓那些容易發現的地址,但不一定每個都收錄。表現就是“抓取量上去了,索引量没跟上”。
怎么判断抓取预算有没有被浪費
可以從日誌和索引报告两邊對照:
- 看日誌里被抓取最多的 URL 類型,是内容頁還是參數頁、列表頁、舊地址。
- 看這些高频抓取 URL 在索引报告里的狀態,是否大量處于“已抓取,未编入索引”。
- 看内鏈和站点地图是否在持續把蜘蛛引向非主版本 URL。
- 看服務器响應,是否有大量 404、301 鏈、超时,拖慢抓取效率。
如果發現抓取集中在低價值頁面上,先別急着加蜘蛛池或外鏈去“催抓取”,那只會让更多頁面被下载,不解决收錄判断的問题。更有效的顺序是:收口 URL 入口、清理重复版本、把内鏈集中到主頁面、把站点地图精简到真正希望被收錄的地址。
調整顺序比增加抓取更重要
抓取预算是一種资源。與其让蜘蛛在几千個參數组合里来回跑,不如让它把時間花在几十個核心内容頁上。可以先把站内 URL 分成三類:必须收錄的主内容、可抓但不强求收錄的辅助頁、不希望被抓的噪音頁。對第一類保證内鏈入口和站点地图覆盖;對第二類控制數量、避免出現在主導航和站点地图;對第三類用 robots、參數處理或連結收口减少曝光。
抓取频次高不是收錄快的保證。蜘蛛来得多,只說明 URL 被發現得容易;能否進索引,還要看頁面在抓取之後能不能通過质量與重复度判断。
另外,蜘蛛池、URL 發現工具能解决的是“让蜘蛛知道 URL 存在”,不能替代頁面质量和 URL 規范。把發現、抓取、收錄三個阶段分開看,排查时就不容易把所有問题都归到“蜘蛛不来”上。