網站收錄

收錄資料對不上 URL 總量:先算清可索引基數,再看覆盖率

收錄數和 URL 總量差距大,多數是口径問题。本文拆開 URL 總量、可索引基數與已收錄數三個數字,說明可索引基數要减掉哪些地址,並给出按模板分组看覆盖率、從索引規則到抓取节奏的排查顺序,避免把设計结果誤判成收錄故障。

網站收錄

收錄資料對不上 URL 總量:先算清可索引基數,再看覆盖率

做收錄检查时,最常见的困惑是:站点一共几萬條 URL,索引里只有几千條,是不是被降權了?大多數情况下,這個差距来自口径不同——你統計的是 URL 總量,而搜尋引擎面對的是“可索引基數”。两個數字没對齐,後面的判断都會偏。

先把三個數字分開

想让结论站得住,至少要区分下面三個數字:

  • URL 總量:爬虫能抓到的地址總數,包含參數、篩選、分頁、重复頁。
  • 可索引基數:這些地址里,你真正希望被收錄、並且允许被收錄的那部分。
  • 已收錄數:索引报告或 site 查询给出的结果,本身带估算成分。

真正该關心的是“已收錄數 ÷ 可索引基數”,而不是“已收錄數 ÷ URL 總量”。分母算错,覆盖率永遠难看。

可索引基數怎么算

從 URL 總量里减掉下面几類,剩下的才接近可索引基數:

  • 明确設定了 noindex 的頁面,比如站内搜尋结果頁、登入頁、部分功能頁。
  • robots.txt 里屏蔽抓取的目錄。注意屏蔽抓取不等于禁止索引,被外鏈指向时仍可能出現在索引里。
  • canonical 统一指向其他地址的重复版本。
  • 排序、追踪、篩選類參數地址,除非它本身就是獨立内容頁。
  • 只承担翻頁功能、没有獨立價值的中間分頁。
  • 返回 404 或 410 的死鏈,以及已经下线的舊地址。

建议按目錄和模板各統計一次。很多站点全站覆盖率看着還行,拆開看却是几個模板在拖後腿。

覆盖率偏低时的排查顺序

  1. 先確認頁面是否真的允许索引:meta noindex、X-Robots-Tag、robots 屏蔽、canonical 是否自指正确。
  2. 再看可抓取性:是否内鏈可達、是否被 JS 渲染阻隔、服務器對爬虫是否返回異常狀態。
  3. 然後看内容同一性:同一模板批量生成的近似頁面,容易被判定為價值不足而合並或排除。
  4. 最後看抓取节奏:新目錄、新模板的抓取本来就滞後,用周為單位观察比按天看更靠谱。

两個容易踩的誤区

  • 把不可索引頁面当成“不收錄問题”。篩選頁被 noindex 是设計结果,不是缺陷。
  • 把 site 查询当准數。它是估算值,在大站上波動明顯,只适合看趋势,不适合看绝對值。
判断收錄健康度,先统一口径:分子是有效收錄,分母是可索引基數,再看分组表現。

一份可落地的清單

  • 導出全站 URL 清單,按目錄、模板、參數類型打标。
  • 给每個分组标注预期狀態:應收錄、應排除、观察中。
  • 只對“應收錄”的组計算覆盖率,其余组检查規則是否按预期生效。
  • 對覆盖率明顯偏低的组,先抽样看頁面本身,再决定改内容、补内鏈還是收敛 URL。

把口径统一之後,你會發現相当一部分“收錄異常”其實是統計方式造成的错觉;剩下的問题再去處理质量與抓取,方向也清楚得多。