做收錄自查时,最常见的做法是拿 sitemap 里提交的 URL 數量当分母,用索引里的頁面數当分子,算出一個收錄率。這個數字看起来直观,實际用起来却经常對不上:有时超過 100%,有时低得离谱。問题往往不在搜尋引擎,而在分母的取法本身。
三種常见的分母,含义完全不同
同样叫可收錄 URL 總量,不同来源得到的集合差別很大:
- sitemap 提交量:你主動列出的 URL,通常只覆盖核心頁面,不含分頁、篩選、搜尋等自動生成的地址。
- 日誌中的 URL 集合:蜘蛛實际請求過的地址,會混入歷史遗留、參數變体和早已下线的頁面。
- 站内連結可達的 URL 集合:從首頁出發顺着連結能走到的全部地址,最接近搜尋引擎有渠道發現的總量。
把這三個數放在一起看,往往能差出几倍。用哪個做分母,取决于你想回答什么問题:想评估提交内容的處理情况就用 sitemap,想评估整站被發現的情况就用站内可達集合。
為什么 sitemap 通常不适合当分母
- sitemap 有數量和体积限制,大站往往只提交重点栏目,長尾頁面不在其中。
- 已经改版、合並或下线的舊 URL 可能還留在文件里,分子里根本没有它們。
- 自動生成的列表頁、标簽頁、參數頁一般不會寫進 sitemap,但它們确實存在于站内。
- sitemap 的更新與抓取之間有滞後,分母會随時間漂移。
所以当你看到提交 500 條、索引 1200 條這種结果时,先別急着判断異常,多數情况下只是两個數字的統計范围不一致。
分子也不干净
索引狀態报告里,已發現、已抓取、重复網頁、备用網頁、已排除是並列的狀態,並不是都算收錄。用哪種口径統計,结论會差很多。如果把已抓取但未编入索引也算作已收錄,收錄率會虚高;只算已编入索引,又會漏掉那些以备用頁面形式存在的正常地址。
另一個常见来源是 site: 查询。它返回的是估算值,波動較大,只适合看數量級變化,不适合做精确的比率計算。
更實用的做法:按頁面類型分桶
與其纠结一個總數,不如把 URL 拆開看。步骤大致如下:
- 從服務器日誌或站内爬虫導出一份完整的 URL 列表。
- 按模板归類:詳情頁、栏目頁、标簽頁、搜尋頁、分頁、带參數的變体。
- 每一類分別統計被索引的比例,而不是混在一起算總分。
- 對比例明顯偏低的類別單獨排查:是否被 noindex 拦住、canonical 是否指向了別處、正文内容是否過少,或者入口連結太深。
這样得到的结果才有可操作性。比如詳情頁索引率九成、标簽頁只有两成,接下来要處理的是标簽頁该不该放開,而不是笼统地去提高收錄率。
收錄比例是体检指标,不是运营目标。真正需要盯的是關键頁面有没有稳定進入索引,以及索引里的版本是否和线上一致。
什么时候才需要關注這個數字
绝對值的參考意义有限,趋势更有用。把同一口径的統計定期记錄,看它在几周内的變化。如果某一類頁面的索引比例出現明顯下滑,再去查抓取量、狀態碼、内容改動和規范标簽的變化,排查范围會小很多。
換句话说,先把分母和分子定义清楚,再谈收錄情况好坏。口径不统一时,讨论收錄率基本没有意义。