在站長後台,很多人只盯着一個數字:索引量。但真正能解释問题的,往往是两個數字放在一起看——蜘蛛抓了多少,和最终被编入索引的有多少。這两個數字長期對不上,說明站点某一段鏈路出了問题。差額本身不是故障,而是一條线索。
先把两個概念分清
抓取覆盖率,指的是蜘蛛在統計周期内實际訪問並讀取的 URL 數量。索引覆盖率,指的是這些 URL 中被搜尋引擎判定為可以展示、並已進入索引的數量。前者衡量蜘蛛愿不愿意来、来不来得及讀;後者衡量讀完以後認不認這個頁面。
抓取是過程,索引是结果。過程顺畅不等于结果理想,结果不理想也未必是抓取的問题。把两者混為一谈,就容易在错誤的方向上做優化。
抓得多、索引少:差額通常出在哪
- 頁面内容高度重复或模板化,蜘蛛讀完判定價值不足。
- canonical、noindex 或 robots 規則把它們主動排除在外。
- 软 404 與空壳頁:返回 200,但正文几乎没有實质内容。
- 參數頁、排序頁、篩選頁生成大量近似 URL,被当作低质量變体。
- 頁面虽然能抓,但主要依赖客戶端渲染,蜘蛛拿到的是一段空壳。
這一類差額,問题往往不在抓,而在頁。繼續加大抓取力度只會放大浪費。
抓得少、索引也不多:先看抓取鏈路
如果抓取覆盖率本身就偏低,索引量自然上不去。常见原因包括:内鏈层級太深,重要頁面没有稳定入鏈;Sitemap 長期不更新,里面躺着大量 404 或重定向;服務器响應偏慢,蜘蛛每次来訪都容易超时;或者抓取額度被低质量目錄頁大量消耗。
抓取額度是被花掉的,不是被分配的。低價值 URL 抓得越多,高價值 URL 排得越靠後。
索引比抓取還多,也別急着高兴
偶尔會出現索引數量大于同期抓取數量的情况,這通常是統計口径與時間窗口造成的:索引資料反映的是歷史累积,抓取資料反映的是近期行為。還有一種可能是,頁面通過其他抓取通道被發現。這類差异一般不需要特別處理,观察趋势即可。
用一份分层清單来排查
- 先看總量趋势:抓取和索引两條曲线是長期背离,還是短周期波動。
- 再分目錄看:把站点按栏目拆分,找出差額最大的那一块。
- 抽样看具体 URL:從差額目錄里随机抽几十條,逐一確認狀態碼、canonical、正文長度。
- 核對内部連結:這些 URL 是否有稳定的站内入口,還是只能靠 Sitemap 被發現。
- 检查服務器响應:平均响應時間、超时比例、5xx 比例是否在可接受范围。
把動作落到能改的地方
差額本身没法一次性抹平,但可以逐段收窄。對内容重复的目錄做合並或加 canonical;對空壳頁补充實质内容,或者干脆去掉入口;對深层頁面补内鏈,缩短從首頁出發的路径;對服務器,優先解决超时,而不是先想着去調抓取频次設定。
每次只改一层,改完等两到四周再對比資料。同时改三五處,最後谁也说不清是哪一步起了作用。抓取與索引的差額,本质上是一份诊断清單,不是一個需要冲高的指标。