做收錄检查时,最常见的困惑是:站点一共几萬條 URL,索引里只有几千條,是不是被降權了?大多數情况下,這個差距来自口径不同——你統計的是 URL 總量,而搜尋引擎面對的是“可索引基數”。两個數字没對齐,後面的判断都會偏。
先把三個數字分開
想让结论站得住,至少要区分下面三個數字:
- URL 總量:爬虫能抓到的地址總數,包含參數、篩選、分頁、重复頁。
- 可索引基數:這些地址里,你真正希望被收錄、並且允许被收錄的那部分。
- 已收錄數:索引报告或 site 查询给出的结果,本身带估算成分。
真正该關心的是“已收錄數 ÷ 可索引基數”,而不是“已收錄數 ÷ URL 總量”。分母算错,覆盖率永遠难看。
可索引基數怎么算
從 URL 總量里减掉下面几類,剩下的才接近可索引基數:
- 明确設定了 noindex 的頁面,比如站内搜尋结果頁、登入頁、部分功能頁。
- robots.txt 里屏蔽抓取的目錄。注意屏蔽抓取不等于禁止索引,被外鏈指向时仍可能出現在索引里。
- canonical 统一指向其他地址的重复版本。
- 排序、追踪、篩選類參數地址,除非它本身就是獨立内容頁。
- 只承担翻頁功能、没有獨立價值的中間分頁。
- 返回 404 或 410 的死鏈,以及已经下线的舊地址。
建议按目錄和模板各統計一次。很多站点全站覆盖率看着還行,拆開看却是几個模板在拖後腿。
覆盖率偏低时的排查顺序
- 先確認頁面是否真的允许索引:meta noindex、X-Robots-Tag、robots 屏蔽、canonical 是否自指正确。
- 再看可抓取性:是否内鏈可達、是否被 JS 渲染阻隔、服務器對爬虫是否返回異常狀態。
- 然後看内容同一性:同一模板批量生成的近似頁面,容易被判定為價值不足而合並或排除。
- 最後看抓取节奏:新目錄、新模板的抓取本来就滞後,用周為單位观察比按天看更靠谱。
两個容易踩的誤区
- 把不可索引頁面当成“不收錄問题”。篩選頁被 noindex 是设計结果,不是缺陷。
- 把 site 查询当准數。它是估算值,在大站上波動明顯,只适合看趋势,不适合看绝對值。
判断收錄健康度,先统一口径:分子是有效收錄,分母是可索引基數,再看分组表現。
一份可落地的清單
- 導出全站 URL 清單,按目錄、模板、參數類型打标。
- 给每個分组标注预期狀態:應收錄、應排除、观察中。
- 只對“應收錄”的组計算覆盖率,其余组检查規則是否按预期生效。
- 對覆盖率明顯偏低的组,先抽样看頁面本身,再决定改内容、补内鏈還是收敛 URL。
把口径统一之後,你會發現相当一部分“收錄異常”其實是統計方式造成的错觉;剩下的問题再去處理质量與抓取,方向也清楚得多。