為什么建议抽样,而不是盯着總數
site: 返回的數字是一個估算值,會随查询词、地区、時間上下浮動;Search Console 的覆盖率报告同样有延迟,並且按分组给出,很难直接對上具体頁面。盯着一個天天變的數字,通常判断不出站点是真的出了問题,還是只是統計口径在抖。
抽样体检的思路是:挑一小批有代表性的 URL,逐個確認它們在抓取、索引、規范三個层面上的狀態,再看這批样本里問题出現的比例和集中方向。它给的不是一個分數,而是一组可以顺着往下查的线索。
样本怎么挑:按頁面類型分层
随机抽 30 個 URL 意义不大,因為不同模板的頁面收錄表現天然不同。更實用的做法是先给站点分层,再從每层里挑代表:
- 首頁與核心栏目頁
- 各频道的内容詳情頁,每個频道取几條
- 列表頁與分頁
- 标簽、篩選、聚合類頁面
- 最近新發布的頁面
- 最近改動過标题或正文的頁面
每层挑 3 到 8 個,總數控制在 20 到 40 個之間。样本不必随机,但一定要能覆盖站点的主要頁面類型。建议把這批 URL 记下来固定在表格里,後面重复使用。
每個样本查五件事
- 是否被抓取。在服務器日誌或 CDN 日誌里確認搜尋爬虫最近是否訪問過這個 URL,返回的狀態碼是什么。
- 是否在索引里。用 site: 精确查询该 URL,或在 Search Console 的網址检查工具里看狀態。要留意的是,site: 查不到並不等于没收錄,它只能作為提示。
- 索引里用的是哪個網址。看搜尋结果展示的是不是你期望的版本,比如 www 與非 www、https、尾斜杠、带參數的變体。
- canonical 是否被采纳。如果頁面自己声明了規范網址,检查索引里的規范網址是不是它,還是被替換成了別的。
- 标题與摘要。展示出来的标题摘要是否来自頁面主要内容。被大量替換,往往說明内容主体没被准确识別。
怎么讀结果
不要看绝對數字,看两件事:問题是否集中在某一层,以及和上一次抽样相比是變好還是變差。
- 如果新頁面這一层普遍没被抓取,問题多半出在站内入口和連結上。
- 如果詳情頁被抓取了,但索引里的規范網址指向了篩選頁或列表頁,問题在 URL 與 canonical 层面。
- 如果所有层表現一致地差,才需要往站点級因素上想,例如服務器稳定性、robots 配置、整体内容质量。
抽样体检的價值不在于给出一個健康分,而在于把“收錄不好”這個模糊的判断,拆成某一层、某一环节上具体可查的問题。
排查顺序:抓取、索引、展示
顺序很重要,不要跳步。上一层没通,下一层的结论就不可靠。
- 没被抓取:先確認内鏈是否可達、robots 是否誤封、服務器是否稳定返回 200。
- 抓取了没進索引:看頁面质量與重复程度,是否與其他頁面高度相似,站内是否明确了主版本。
- 進了索引但展示不對:检查标题摘要、结构化資料、canonical 與同頁多址的情况。
每次只解决目前這一层的問题。修完之後隔一段時間,用同一批 URL 再抽一次,通過前後對比来驗證改動是否有效,而不是改完当天就下结论。
几個常见誤判
- 把 site: 的结果數量当成精确的收錄量。
- 用一次查询就下结论,忽略地区、語言、设备差异带来的變化。
- 把爬虫来得频繁当成收錄良好,其實抓取和索引是两件事。
- 頁面刚改完就检查,没有给重新抓取和更新留出時間。
把抽样做成固定動作,比如每月一次、每次使用同一批样本,長期看趋势,會比每天刷新某個數字有用得多。它不會让收錄立刻變好,但能让你在問题還小的时候先發現它。