網站收錄

给收錄做抽样体检:用一小批 URL 判断索引健康度

site: 數字天天在變,覆盖率报告又有延迟,光看總數很难判断收錄到底正常不正常。與其盯着一個波動的大數字,不如按頁面類型分层抽出 20-40 個 URL,逐個確認抓取狀態、索引狀態、索引里的規范網址和展示结果,再按抓取、索引、展示的顺序排查。本文给出样本挑選方法、五個检查項和几個常见誤判。

網站收錄

给收錄做抽样体检:用一小批 URL 判断索引健康度

為什么建议抽样,而不是盯着總數

site: 返回的數字是一個估算值,會随查询词、地区、時間上下浮動;Search Console 的覆盖率报告同样有延迟,並且按分组给出,很难直接對上具体頁面。盯着一個天天變的數字,通常判断不出站点是真的出了問题,還是只是統計口径在抖。

抽样体检的思路是:挑一小批有代表性的 URL,逐個確認它們在抓取、索引、規范三個层面上的狀態,再看這批样本里問题出現的比例和集中方向。它给的不是一個分數,而是一组可以顺着往下查的线索。

样本怎么挑:按頁面類型分层

随机抽 30 個 URL 意义不大,因為不同模板的頁面收錄表現天然不同。更實用的做法是先给站点分层,再從每层里挑代表:

  • 首頁與核心栏目頁
  • 各频道的内容詳情頁,每個频道取几條
  • 列表頁與分頁
  • 标簽、篩選、聚合類頁面
  • 最近新發布的頁面
  • 最近改動過标题或正文的頁面

每层挑 3 到 8 個,總數控制在 20 到 40 個之間。样本不必随机,但一定要能覆盖站点的主要頁面類型。建议把這批 URL 记下来固定在表格里,後面重复使用。

每個样本查五件事

  1. 是否被抓取。在服務器日誌或 CDN 日誌里確認搜尋爬虫最近是否訪問過這個 URL,返回的狀態碼是什么。
  2. 是否在索引里。用 site: 精确查询该 URL,或在 Search Console 的網址检查工具里看狀態。要留意的是,site: 查不到並不等于没收錄,它只能作為提示。
  3. 索引里用的是哪個網址。看搜尋结果展示的是不是你期望的版本,比如 www 與非 www、https、尾斜杠、带參數的變体。
  4. canonical 是否被采纳。如果頁面自己声明了規范網址,检查索引里的規范網址是不是它,還是被替換成了別的。
  5. 标题與摘要。展示出来的标题摘要是否来自頁面主要内容。被大量替換,往往說明内容主体没被准确识別。

怎么讀结果

不要看绝對數字,看两件事:問题是否集中在某一层,以及和上一次抽样相比是變好還是變差。

  • 如果新頁面這一层普遍没被抓取,問题多半出在站内入口和連結上。
  • 如果詳情頁被抓取了,但索引里的規范網址指向了篩選頁或列表頁,問题在 URL 與 canonical 层面。
  • 如果所有层表現一致地差,才需要往站点級因素上想,例如服務器稳定性、robots 配置、整体内容质量。
抽样体检的價值不在于给出一個健康分,而在于把“收錄不好”這個模糊的判断,拆成某一层、某一环节上具体可查的問题。

排查顺序:抓取、索引、展示

顺序很重要,不要跳步。上一层没通,下一层的结论就不可靠。

  • 没被抓取:先確認内鏈是否可達、robots 是否誤封、服務器是否稳定返回 200。
  • 抓取了没進索引:看頁面质量與重复程度,是否與其他頁面高度相似,站内是否明确了主版本。
  • 進了索引但展示不對:检查标题摘要、结构化資料、canonical 與同頁多址的情况。

每次只解决目前這一层的問题。修完之後隔一段時間,用同一批 URL 再抽一次,通過前後對比来驗證改動是否有效,而不是改完当天就下结论。

几個常见誤判

  • 把 site: 的结果數量当成精确的收錄量。
  • 用一次查询就下结论,忽略地区、語言、设备差异带来的變化。
  • 把爬虫来得频繁当成收錄良好,其實抓取和索引是两件事。
  • 頁面刚改完就检查,没有给重新抓取和更新留出時間。

把抽样做成固定動作,比如每月一次、每次使用同一批样本,長期看趋势,會比每天刷新某個數字有用得多。它不會让收錄立刻變好,但能让你在問题還小的时候先發現它。