網站收錄

收錄率该怎么算:分母口径不同,结论會差很遠

收錄率這個指标常被引用,但分子和分母的口径不同,结论可能完全相反。本文說明三種常见分母取法、三個分子資料源的偏差,以及按模板分层核對的做法,帮助你把收錄資料落到具体動作上。

網站收錄

收錄率该怎么算:分母口径不同,结论會差很遠

“站点收錄得怎么样”几乎是每次复盘都會被問到的問题,但真正值得先問的是:這個數字是怎么算出来的。收錄率本身不是坏指标,只是它的分子和分母都很容易被随意定义,口径一變,结论可能完全相反。

分子和分母,先寫清楚再谈高低

收錄率大致等于“已被索引的 URL 數”除以“我們希望被抓取和索引的 URL 總數”。两個數看着直白,實际都有多種取法。

  • 分母取 sitemap 里的 URL 數量:适合主動提交的站点,但 sitemap 往往落後于真實頁面。
  • 分母取資料库里“對外可訪問”的頁面數:更接近真實規模,但需要先排除 noindex、已下架、參數拼接等頁面。
  • 分母取日誌中出現過的 URL 數量:反映搜尋引擎實际看到過的范围,通常比前两者都大。

分母不同,同一個站点算出来的收錄率可能相差几十個百分点。所以在看這個指标之前,最好把它背後的定义寫在报表里,而不是只留一個百分比给人猜。

分子從哪里讀:三個資料源各有偏差

索引报告

索引报告按模板和狀態聚合,适合看趋势和分布,但資料存在延迟,而且“已编入索引”不代表有展示、有流量。

site: 查询

它只能给出粗略量級,结果會随查询词、地区、時間波動。用它的條數去算收錄率,誤差往往比预期大,更适合做前後對比,而不是绝對計數。

日誌與 URL 检查

日誌能告诉你搜尋引擎来過哪些 URL、返回了什么狀態碼;URL 检查能確認單個 URL 的真實索引狀態。两者结合适合做抽样核對,但不适合全站統計。

口径不同,會带来什么结论

假设一個站点有 5000 個對外可訪問的頁面,其中 3000 個進了 sitemap,最终被索引的有 2800 個。

  • 以 sitemap 為分母:收錄率约 93%,看上去很好。
  • 以可訪問頁面為分母:约 56%,看上去需要處理。

两個數字都没算错,但指向的動作完全不同。前一個會让人以為没問题,後一個會推動你去查剩余頁面為什么没進索引——答案常常在模板质量、内鏈分發或參數重复上,而不是什么“降權”。

更實用的做法:分层算,而不是全站一個數

  1. 按模板分组:詳情頁、列表頁、标簽頁、篩選頁、帮助頁等分別統計。
  2. 每组固定分母口径,下次核對时保持一致,避免口径漂移。
  3. 每组抽十几個 URL,用 URL 检查或日誌確認實际狀態。
  4. 比較各组之間的差异,而不是只盯全站平均值。

平均值會把問题摊平。如果詳情頁收錄率 60%、列表頁收錄率 98%,全站平均可能是 85%,你從這個數里看不出该修哪里。

几個常见誤讀

  • 把收錄率高当成健康:薄内容頁大量被索引,短期數字好看,長期是负担。
  • 把收錄率低当成惩罚:更常见的原因是模板差异、抓取分配、内鏈不足。
  • 拿一次資料下结论:索引狀態會随抓取和更新變化,固定周期看趋势更有意义。
  • 忽略分母里本就不该收錄的頁面:這些頁面應当先排除,而不是等它拉低整体比例。
收錄率是内部管理指标,不是對外成绩單。它的價值在于分层對比和趋势跟踪,而不是一個孤立的百分比。

與其争一個數字的高低,不如把口径寫清楚、把分母拆開、按模板看差异。這样得到的结论才能落到具体動作上:是补内鏈、合並重复頁,還是調整模板结构。