很多站点的問题不是完全没有抓取,而是抓取次數花在了不该花的地方。抓取和收錄是两件事:頁面被爬虫訪問只是進入候選,能不能進索引還要看内容本身;但如果连抓取都没轮到,後面所有判断都缺少前提。所以当重要頁面更新後迟迟没反應时,與其先怀疑收錄規則,不如先看清抓取次數落到了哪些 URL 上。
抓取次數有限,但別把它当成固定額度
搜尋引擎不會给每個站点分配一個明确數字的抓取額度,而是根據站点响應速度、内容更新频率、歷史质量信号動態調整。這意味着两件事:一是整体抓取量可以随站点表現變好而上升,二是低價值 URL 占比過高确實會挤压重要頁面被訪問的机會。讨论的重点因此不是數量是多少,而是抓取结构是否合理。
從服務器日誌先看三個点
一、抓取總量與响應耗时
先按天看来自搜尋引擎的請求總數,再看這些請求的平均响應時間和超时比例。如果服務器在高峰期响應明顯變慢,爬虫往往會主動降低訪問频率,這时抓取量下降不一定和内容有關,先把服務端問题排除掉。
二、狀態碼分布
把日誌里的狀態碼归類統計:正常返回、跳轉、不存在、被拒绝、服務端错誤。如果跳轉和错誤狀態占了不小比例,說明爬虫有相当一部分訪問是無效的,這些訪問同样消耗机會。跳轉鏈路過長、站内大量失效連結,都属于這一類。
三、被抓取 URL 的類型分布
把被抓取的 URL 按目錄或參數特征归類,看看哪些類型占比異常。常见的消耗大戶包括:站内搜尋结果頁、排序與篩選參數组合、没有實际内容的分頁、标簽與日期归档、已下线的舊路径。這一层統計比總量數字更有指導意义。
哪些類型通常值得繼續被抓
- 有獨立主题、能獨立满足搜尋需求的正文頁;
- 作為重要内容入口的频道頁、聚合頁,前提是内容确實在更新;
- 近期有實质修改、且對用戶仍有價值的頁面;
- 承接站内連結、能被正常点击到達的路径。
哪些類型可以先考虑收紧
- 由參數组合生成、内容高度重复的頁面;
- 站内搜尋结果頁,尤其是结果為空或结果不稳定的;
- 内容极薄或纯占位的頁面,例如空分類、只有标题的归档;
- 已经確認不再维護、且没有替代内容的舊路径。
收紧时的處理顺序
顺序比手段更重要。一般建议先修連結结构,再改抓取入口,最後才動頁面級指令。原因是:如果站内還有大量連結指向這些 URL,即使做了限制,爬虫仍會不断尝试,反而制造更多無效訪問。
需要区分两件事:阻止抓取會同时阻止收錄,而頁面級的不索引指令需要頁面能被抓取才會被讀到。用错工具,结果往往和预期相反。
具体操作上,可以先從這几步走:
- 把不该被發現的 URL 從站内連結、站点地图里移除或改指向;
- 對确實需要保留但不宜進入索引的頁面,單獨使用頁面級不索引指令;
- 對本来就不该被抓取的目錄,再考虑在抓取規則里限制;
- 保留一份改動清單,方便之後核對效果。
調整之後怎么观察
改動通常不會立刻见效。建议按两周左右的窗口對比:總抓取量、重要頁面的被抓取次數、無效狀態碼占比,以及目标頁面從被抓取到被收錄的變化情况。如果總抓取量下降但重要頁面被抓取次數上升,通常說明结构在改善;如果两者同时下降,就要回看是否限制過度。
小结
抓取和收錄的区別在于,抓取决定有没有机會,收錄决定有没有结果。当抓取次數被大量低價值 URL 占用时,先修入口和連結,再動限制指令,最後用日誌核對效果。這個顺序看起来慢,但比反复改規則更容易看清問题出在哪一层。