網站收錄

收錄數量對不上:CMS、sitemap 與索引报表的核對顺序

CMS 後台的發布數、sitemap 里的 URL 數、索引报表里的已收錄數,三個數字几乎不會相等。差异本身不代表出了問题,關键是要知道差在哪一环。本文把三套數字的口径拆開,给出一個可执行的核對顺序,並說明哪些差异其實可以放着不管。

網站收錄

收錄數量對不上:CMS、sitemap 與索引报表的核對顺序

很多站長习惯把三個數字放在一起比:CMS 後台發布過多少内容、sitemap 里提交了多少條 URL、搜尋後台顯示多少條已编入索引。這三個數字几乎永遠不會相等。差异本身並不說明站点出了問题,真正需要弄清楚的是——差在哪一环。

三套數字的口径本来就不一样

CMS 後台數的是“内容记錄”

它統計的是發布動作,不是 URL。草稿、定时未發布、已经下线、被設定了 noindex 的頁面,往往也算在内。如果同一篇内容同时存在多個版本(多語言、PC 與移動、带參數的地址),CMS 里可能只有一條记錄,线上却對應好几個地址。

sitemap 數的是“你希望被抓的 URL”

理论上一份健康的 sitemap,應该只放可索引、返回 200、内容完整的地址。但實际维護中常常混進失效連結、重定向地址、追踪參數地址;反過来,新上线的栏目也经常忘记补進去。所以這個數字是“意图”,不是“结果”。

索引报表數的是“搜尋系統認為能出現在结果里的 URL”

它同时受抓取情况和质量判断影响。相似内容被合並到主版本、低價值頁面被判定不值得收錄,都會让這個數字低于你提交的數量。它反映的是结果,不是你的期望。

常见的差异来源

  • 一個内容對應多個 URL:分頁、篩選、排序、打印頁、带追踪參數的地址
  • 頁面被 noindex 或 robots.txt 拦截,但仍然留在 sitemap 里
  • 已下线頁面没有從 sitemap 移除,長期挂着失效地址
  • 重定向鏈上的中間地址曾经被抓取過,仍留在統計中
  • 重复或高度相似的内容被合並,只保留一個主版本
  • 新頁面還没被抓取,或者抓取後仍在等待處理
  • sitemap 分片更新滞後,索引里保留着舊分片的地址

建议的核對顺序

  1. 先固定口径。選一個時間点,導出 sitemap 中的全部 URL,逐條確認狀態碼,去掉非 200 的地址,得到一份“可索引 URL 基线”。
  2. 再和 CMS 對比。找出 CMS 里有、基线里没有的頁面。這類通常是被 noindex、被 robots 拦截,或者压根没進 sitemap,属于可控問题。
  3. 最後看索引报表。從基线里按栏目、按模板抽样,去查這些 URL 是否真的被索引,而不是只看總數。
  4. 分三類记錄。抓取問题、质量合並、技術拦截分開归档,避免所有差异都混成一句“收錄不好”。

哪些差异可以暂时不管

索引數量少于 sitemap 數量是常態,不是故障信号。

如果差异主要集中在參數頁、分頁、篩選頁、已被合並的重复頁,以及本来就設定了 noindex 的頁面,通常不需要专门處理,把精力放在内容頁上更划算。

什么时候才需要動手

两種情况值得排查:一是核心内容頁(栏目主頁、正文頁)長期不在索引里,或者反复處于已抓取未编入索引的狀態;二是索引里出現大量你並不希望被收錄的地址,比如站内搜尋结果頁、測試頁、带參數的组合頁。這两種情况說明問题出在 URL 管理或頁面质量上,而不只是統計口径差异。

把這三個數字当成三張用途不同的报表,而不是互相校驗的答案。核對的意义在于定位差异来源,而不是把它們調成一样。