日誌里蜘蛛来訪很多,索引量却没變化,是运营中很常见的困惑。原因通常不是蜘蛛偷懒,而是把“抓取”和“收錄”当成了同一件事来看。
两件事的邊界
抓取是蜘蛛把你的 URL 取回服務器,拿到 HTML 以及後續的渲染结果;收錄是搜尋引擎把這套内容處理、评估之後放進索引,可以在结果里被检索到。中間至少隔着:URL 發現、抓取調度、内容解析與渲染、质量與去重判断、索引寫入。任何一步卡住,表面現象都是“抓過但没收錄”。
為什么抓取量會虚高
- 蜘蛛爬的是你並不想收錄的 URL:參數頁、篩選頁、重复列表,取回後判定價值不足,直接丢弃。
- 同一份内容存在多個 URL 變体,蜘蛛反复到訪,實际只對應一份内容。
- 响應层不稳,蜘蛛来了却拿到超时或错誤頁,抓取次數計入,正文没拿到。
- 靠蜘蛛池或其他入口引来的抓取,很多落在低價值頁面上,並不改變索引结构。
所以抓取次數上升,只能說明蜘蛛愿意来,不能說明它愿意收。
按顺序排查會更清楚
- 先看抓取的是哪些 URL。按目錄、頁面類型分组統計,判断新增抓取落在核心頁還是碎片頁。
- 再看返回狀態和响應体。狀態碼 200 但内容是空壳、跳轉頁、驗證頁,等于没抓到有效内容。
- 然後看頁面是否可索引。是否存在 noindex、canonical 指向別處、需要登入才可见等情况。
- 最後看内容本身是否值得收。與站内已有頁面高度重合,或只是简單聚合列表,通常不會單獨進索引。
URL 發現的质量决定上限
蜘蛛能找到什么,取决于你把什么放在它面前。内鏈、站点地图、主動提交是主要的發現渠道,這些渠道里如果混入大量排序與篩選參數,抓取配額就會被消耗在不會被收錄的地址上。想提升有效抓取,先整理發現入口,比繼續堆 URL 更實际。
把“蜘蛛来過”当成進度,很容易做出错誤决策:繼續加頁面,而不是先修頁面。
指标要分開讀
建议同时记錄三個數:按頁面類型統計的抓取次數、有效抓取比例(拿到可索引内容的比例)、已收錄 URL 數。有效抓取高而收錄低,問题多在内容與規范化;有效抓取本身就低,問题多在發現和响應层。
一個简單的记錄习惯
每周固定時間记錄同類型頁面的抓取量與收錄變化,而不是只盯站点總量。類型之間的差异,往往比總量波動更能說明問题出在哪一环。