讨论收錄情况时,“收錄率”几乎是最常被提起的數字,但它也是最容易被算错的數字之一。同一個站点,換一個分母,收錄率可能從 30% 變成 80%。所以在拿這個數字做判断之前,先要明确:你到底把什么算進了分母。
分母的三種常见来源
實际操作中,收錄率的分母通常来自三個地方,它們對應的结论完全不同。
- 站点地图里提交的 URL 數:最容易拿到,也最容易失真。如果站点地图長期没有维護,里面還留着已刪除、已改版、带參數的舊地址,分母就會被抬高,收錄率看起来永遠偏低。
- 抓取日誌里去重後的 URL 數:反映的是搜尋引擎實际遇到過哪些地址,而不是站点希望被收錄哪些。日誌里往往包含大量重复、參數和無關目錄,同样不适合直接当分母。
- 站内真實可索引的頁面數:把返回 200、没有 noindex、主体内容不依赖脚本渲染、内鏈可達的頁面筛出来,這是最接近“應该被收錄”的口径。
如果只是想知道站点整体健康度,用第三種分母更有意义;如果只是想驗證站点地图是否有效,才用第一種。两種口径不要混着用,更不要拿其中一種算出的百分比去解释另一種的問题。
分子也不止一個来源
分子常被預設成後台顯示“已编入索引”的數量,但這個數字本身就有口径差异:它統計的是某個资源下所有被索引的 URL,其中可能包括你未必想要的那些。索引狀態报告、URL 检查工具、站内搜尋指令给出的结果经常對不上,因為統計范围和時間窗不同。
比較稳妥的做法是:選定一個来源,長期只用它做纵向對比。不要今天用 A、明天用 B,然後得出“收錄掉了”的结论。
把收錄率拆開看
全站收錄率 70% 這個數字本身没什么用,因為它可能由一批收錄率 95% 的文章頁和一批收錄率 10% 的篩選頁平均而来。更有價值的做法是按目錄、按模板、按頁面類型分別統計:
- 文章詳情頁與产品詳情頁
- 列表頁與分頁地址
- 标簽頁、聚合頁
- 带篩選或排序參數的地址
拆開之後,通常能立刻看出問题集中在哪一類模板,而不是笼统的“全站收錄差”。
收錄率偏低时的排查顺序
- 先確認分母里没有混進不该收錄的地址:noindex 頁面、重定向、404、纯參數頁。
- 再看抓取日誌:蜘蛛是否真的到達過這些 URL,還是停留在發現阶段。
- 看頁面本身:内容是否過薄、是否與其他頁面高度重复、主体内容是否必须渲染後才出現。
- 看入口:這些頁面能否在站内几個点击内到達,有没有稳定的内鏈指向。
- 最後看時間:新頁面從被發現到進入索引本身需要周期,刚上线几天的頁面不适合放進統計。
哪些數字不必追
收錄率高不等于流量高,收錄率低也不一定說明站点有問题。有些頁面類型本来就不该被收錄,把它們算進分母再追求 100%,只會让团队去做没有意义的動作。
把分母定清楚,把統計口径固定下来,再按目錄拆開看,收錄率才是一個能用来做判断的指标。否則它只是一個每次計算都不同、却看起来很像结论的數字。