網站收錄

收錄核對別只盯首頁:按模板分组的抽样方法

收錄核對如果只看首頁和主力頁面,很容易得出错誤结论。這篇文章给出一套可重复的抽样方法:先按頁面模板把 URL 分组,再确定每组抽哪些样本、记錄哪些字段,最後用组内一致性和组間差异判断問题出在模板层面還是單個頁面。

網站收錄

收錄核對別只盯首頁:按模板分组的抽样方法

收錄核對最常见的誤区,是打開报表看總量,再随手查首頁和几篇主力文章,發現“收錄正常”就結束了。這種做法在很小的站点上偶尔够用,一旦 URL 數量到了几百上千,结论往往站不住:首頁和主力頁恰恰是最不愁收錄的那批,它們進了索引,並不能說明产品頁、篩選頁、歷史归档頁也進了索引。

總量以下,先按模板把 URL 分组

同一套模板生成的頁面,在抓取和索引上的表現通常高度相似:要么整组都能進,要么整组卡在同一個环节。所以抽样之前,先把站点 URL 按模板归類,一般可以分成這几组:

  • 首頁與栏目首頁
  • 内容詳情頁(文章、商品、問答等)
  • 聚合列表頁(分類、标簽、归档、站内搜尋结果頁)
  • 功能性頁面(帮助、條款、登入後可见頁)
  • 由參數或多條路径生成的變体 URL

分组的作用,是把“全站收錄率”這種模糊指标,拆成几组可以互相對比的數字。某一组明顯偏低时,問题多半出在這组共用的模板或内鏈结构上,而不是随机波動。

每组抽哪些頁面

样本要兼顾随机和邊界。全部随机抽,容易漏掉真正被卡住的頁面;只挑邊界样本,又容易把個別現象当成普遍規律。一個简單做法是每组各取 10 到 20 個 URL,其中包含:

  1. 最近一周内新發布或刚改版的頁面;
  2. 發布較久、已有外鏈或稳定訪問的頁面;
  3. 從站内入口点击路径較深的頁面;
  4. 内鏈數量差异明顯的两個极端样本;
  5. URL 结构上有特殊字符、多級路径或參數的頁面。

样本量不必很大,但要尽量固定下来,下一次核對时沿用同一批。固定样本的價值在于可以纵向比較,看出狀態是變好還是變差;每次換一批新样本,只能得到两個互不相干的快照。

每個样本记什么

只记“收錄/未收錄”信息太少,建议同时记錄下面几項,方便後面判断卡在哪一步:

  • 索引狀態(已收錄、已發現未抓取、已抓取未编入索引、已排除等);
  • 最近一次抓取時間,以及這段時間内頁面内容是否更新過;
  • 索引到的版本是否與线上一致(标题、canonical、正文要点);
  • 被發現的主要入口:内鏈、站点地图,還是外部連結。
狀態字段只是辅助判断工具。不同搜尋引擎的叫法和颗粒度不一样,也可能存在延迟或阶段性波動。它用来缩小排查范围,不适合给頁面下最终结论。

抽样结果怎么讀

先看组内一致性,再看组間差异。如果某個模板下十個样本有八個是同一狀態,基本可以判断是模板层面的問题;如果狀態參差不齐,更可能與單頁内容、内鏈位置或發布時間有關。

组間比較則用来排優先級。詳情頁收錄正常、聚合頁大量未收錄,處理顺序就應该從聚合頁入手,而不是去改詳情頁模板。反過来,如果各组表現都不理想,那要回到更上游的环节:抓取是否顺畅、站点地图是否有效、服務器是否频繁返回错誤狀態。

几個容易踩的坑

  • 只看總量比例:總量里混着不同模板,整体數字好看不代表每组都健康。
  • 样本太少:三五個 URL 得出的结论,很容易被個案带偏。
  • 用首頁代表全站:首頁通常内鏈和外鏈最多,它被收錄几乎說明不了什么。
  • 一次核對就下结论:索引狀態本身會随時間變化,單次快照只說明当下。

把它變成固定节奏

抽样核對适合按周或双周做一次,记錄格式保持稳定,改動前後各留一份對照。時間拉長之後,你看到的就不再是“今天收錄了多少”這種單点數字,而是各组模板随時間的變化趋势。對站点运营来说,這條趋势比任何一次性的收錄量都更有參考價值。