很多站点运营會遇到這種情况:一批頁面同一天上线、结构相近、内容長度也差不多,過一段時間去核對,有的已经在索引里,有的還停留在“已發現但未编入索引”。這时候如果只看蜘蛛来没来,很容易得出错誤结论——日誌里蜘蛛确實来過,問题往往不在訪問本身,而在抓取量被分给了谁。
一、先把抓取和收錄拆成两步
抓取是蜘蛛把頁面下载回去,收錄是搜尋引擎判断這個頁面值不值得放進索引。两步之間還夹着一层“值不值得抓”的取舍。日誌里出現抓取請求,只能說明頁面被訪問過,不能說明它會被收錄。反過来,一個頁面長時間没被抓,也不一定是被封了,很可能是抓取配額優先给了別處。
抓取是過程,收錄是结果。把两者混在一起看,就會把配額分配問题誤判成頁面被拒問题。
二、抓取配額不是平均分配的
站点的可抓取资源是有限的。搜尋引擎會综合站点体量、更新频率、响應速度、頁面價值来决定先抓哪些、抓多深、抓多频繁。所以同一批頁面出現先後差异,往往是下面几類東西在占額度:
- 大量低價值 URL:篩選參數组合、排序參數、會话參數生成的頁面,數量可能遠超正文頁。
- 無限翻頁和日歷归档:没有出口的列表、按日期铺開的归档頁,很容易被持續爬取。
- 歷史残留地址:老的跳轉鏈、已经不用的路径,仍被反复訪問。
- 重复内容:同一篇内容挂在多個栏目、多個 URL 下,每個地址都要消耗一次抓取。
- 慢响應:响應時間長的頁面會拖慢整站抓取节奏,尤其在同一主机下。
把這些加在一起,就能解释為什么新頁面排不上队。
三、核對时按這個顺序排查
- 先從服務器日誌里筛出最近一段時間被訪問最多的 URL 類型,看是不是集中在參數頁、列表頁或归档頁。
- 確認這些高频被抓的 URL 是否有獨立價值,没有的话就该考虑收敛,而不是繼續放大。
- 检查重要頁面的内鏈入口是不是太少。入口少的頁面,被抓的机會本身就低。
- 對比重要頁面和低價值頁面的响應時間,慢的那一批往往會拖累整体。
- 最後再看收錄狀態,区分“已發現但未编入索引”和“已抓取但未编入索引”,判断卡点在哪一步。
四、给重要頁面腾額度,而不是硬催
調整的思路通常是做减法:把不打算被索引的 URL 用 robots 或 noindex 處理干净,把跟踪參數在站内連結里去掉,把重复内容归並到主版本,把翻頁逻辑做出合理出口。這些動作不會立刻带来收錄變化,但能逐步把抓取重心移回正文頁。
同时別忽略站点本身的响應能力。服務器慢、頁面打開時間長的时候,再谈抓取配額意义不大,因為額度再多也會被慢速請求消耗掉。
五、几個容易誤判的情况
- 蜘蛛訪問频繁:可能只是在反复抓同一個低價值地址,不等于新頁面被重视。
- 索引量上涨:涨的可能是不该收的頁面,需要按類型拆開看。
- site 查询结果變少:查询结果數不等于索引量,不适合当作唯一指标。
- sitemap 提交了很多次:提交只是提供發現渠道,不决定抓取優先級。
核對這件事更像是做帳:先把抓取流量花在哪里看清楚,再决定哪些頁面值得留、哪些该收掉。顺序對了,很多“為什么它没被收錄”的問题會自己浮出答案。