抓到和收錄是两件事
服務器日誌里蜘蛛几乎天天来,頁面被反复抓取,但索引狀態里始终没有新增,這種落差很常见。原因在于抓取只是蜘蛛把内容讀走,收錄是搜尋引擎判断這份内容值不值得放進索引、要不要在结果里展示。中間的判断标准是内容质量和重复度,不是抓取次數。
把這两個指标混在一起看,很容易得出错誤结论:以為蜘蛛来得少,就拼命提升抓取频次;實际上問题可能出在被抓的那些頁面本身没有單獨收錄的價值。
抓取频次高,收錄却不動,通常卡在三個地方
- 頁面本身不值得單獨立索引:内容极少、與主頁面高度重合的副頁面、纯篩選结果頁,即使被抓很多次也不會進索引。
- 同一批内容被拆成多個 URL:大小寫、结尾斜杠、带追踪參數的版本,被抓的是這一堆,索引里通常只保留其中一個代表。
- 抓取入口太集中:蜘蛛一直围着首頁、栏目頁和几個热门詳情頁轉,新頁面根本没被走到,日誌里自然看不到。
抓取预算容易被谁吃掉
蜘蛛在一個站点上的抓取量有上限,浪費在低價值 URL 上,真正需要被發現的新頁面就分不到額度。
- 站内搜尋结果頁,以及排序、篩選组合出来的參數 URL;
- 已经 404 或 410、但仍有大量内鏈指向的舊地址;
- 要经過多层重定向才能到達终点的連結;
- robots.txt 已屏蔽、内鏈却還繼續指向的目錄;
- 翻到几十頁之後、本身没有獨立價值的列表頁。
這些 URL 不一定马上带来問题,但它們每次被訪問都會消耗一次抓取,挤压新内容的發現机會。數量越积越多,日誌看上去很热闹,實际有效抓取並没有增加。
用日誌和索引狀態對一遍
- 從日誌里筛出蜘蛛訪問過的 URL,按目錄和參數類型分组,看抓取量集中在哪一類。
- 把抓取量最高的那批 URL 拿去查索引狀態,区分「抓了没收」和「收了但没有展示」。
- 再對照最近發布的新頁面,看它們第一次被抓距發布隔了多久,是否有稳定入口能到達。
- 把「抓了很多次且一直没收」的類別标记出来,這就是下一轮要處理的對象。
調整動作的顺序
先別急着做新的内容堆量。更有效的顺序是:先把不该被抓的 URL 收口,比如屏蔽無意义參數组合、清理失效連結、统一重复版本,让抓取集中到有收錄價值的頁面上;再检查這些頁面的内鏈入口是否通畅,保證新頁面發布後能在較短時間被走到。
別把抓取频次当成考核指标
抓取频次會因為站点体量、内容更新节奏、頁面權重而自然波動。它上升不代表收錄會變好,下降也不等于出了問题。真正需要盯的是:新頁面多久被發現、有多少 URL 反复被抓却始终進不了索引、索引里的頁面能不能拿到展示。盯這些结果,比盯蜘蛛来了几次更有意义。
抓取频次是過程指标,收錄和展示才是结果。排查时先看结果,再回头看過程哪里卡住。