很多站長习惯把三個數字放在一起比:CMS 後台發布過多少内容、sitemap 里提交了多少條 URL、搜尋後台顯示多少條已编入索引。這三個數字几乎永遠不會相等。差异本身並不說明站点出了問题,真正需要弄清楚的是——差在哪一环。
三套數字的口径本来就不一样
CMS 後台數的是“内容记錄”
它統計的是發布動作,不是 URL。草稿、定时未發布、已经下线、被設定了 noindex 的頁面,往往也算在内。如果同一篇内容同时存在多個版本(多語言、PC 與移動、带參數的地址),CMS 里可能只有一條记錄,线上却對應好几個地址。
sitemap 數的是“你希望被抓的 URL”
理论上一份健康的 sitemap,應该只放可索引、返回 200、内容完整的地址。但實际维護中常常混進失效連結、重定向地址、追踪參數地址;反過来,新上线的栏目也经常忘记补進去。所以這個數字是“意图”,不是“结果”。
索引报表數的是“搜尋系統認為能出現在结果里的 URL”
它同时受抓取情况和质量判断影响。相似内容被合並到主版本、低價值頁面被判定不值得收錄,都會让這個數字低于你提交的數量。它反映的是结果,不是你的期望。
常见的差异来源
- 一個内容對應多個 URL:分頁、篩選、排序、打印頁、带追踪參數的地址
- 頁面被 noindex 或 robots.txt 拦截,但仍然留在 sitemap 里
- 已下线頁面没有從 sitemap 移除,長期挂着失效地址
- 重定向鏈上的中間地址曾经被抓取過,仍留在統計中
- 重复或高度相似的内容被合並,只保留一個主版本
- 新頁面還没被抓取,或者抓取後仍在等待處理
- sitemap 分片更新滞後,索引里保留着舊分片的地址
建议的核對顺序
- 先固定口径。選一個時間点,導出 sitemap 中的全部 URL,逐條確認狀態碼,去掉非 200 的地址,得到一份“可索引 URL 基线”。
- 再和 CMS 對比。找出 CMS 里有、基线里没有的頁面。這類通常是被 noindex、被 robots 拦截,或者压根没進 sitemap,属于可控問题。
- 最後看索引报表。從基线里按栏目、按模板抽样,去查這些 URL 是否真的被索引,而不是只看總數。
- 分三類记錄。抓取問题、质量合並、技術拦截分開归档,避免所有差异都混成一句“收錄不好”。
哪些差异可以暂时不管
索引數量少于 sitemap 數量是常態,不是故障信号。
如果差异主要集中在參數頁、分頁、篩選頁、已被合並的重复頁,以及本来就設定了 noindex 的頁面,通常不需要专门處理,把精力放在内容頁上更划算。
什么时候才需要動手
两種情况值得排查:一是核心内容頁(栏目主頁、正文頁)長期不在索引里,或者反复處于已抓取未编入索引的狀態;二是索引里出現大量你並不希望被收錄的地址,比如站内搜尋结果頁、測試頁、带參數的组合頁。這两種情况說明問题出在 URL 管理或頁面质量上,而不只是統計口径差异。
把這三個數字当成三張用途不同的报表,而不是互相校驗的答案。核對的意义在于定位差异来源,而不是把它們調成一样。