為什么建议用抽样,而不是全站核對
收錄狀態不是一次就能查清的固定属性。它随抓取频率、索引刷新、頁面改動而變化,同一批 URL 今天查和下周查,结果可能不同。如果你的站点有几千甚至几萬個 URL,逐條去核對既不現實,得到的也只是一張某一时刻的快照。
抽样要解决的不是“一共收錄了多少”,而是“哪一類頁面出了問题”。只要样本分层合理,几十個 URL 就能给出足够明确的方向,再决定要不要往下深挖。
先分层,再抽样
随机的 100 個 URL 參考價值有限,因為站内頁面本来就不是同质的。商品頁、文章頁、列表頁、帮助文档,它們的入口深度、更新频率、模板结构差別很大,混在一起抽,問题會被稀释掉。建议至少按下面几個维度切一层:
- 按目錄或模板分:不同栏目往往共用不同模板,出問题也常常是模板級的。
- 按入口深度分:首頁直接連結的頁面,和需要点四五层才到的頁面,抓取机會本就不同。
- 按上线時間分:新上线的頁面和两三年前的老頁面,遇到的問题類型通常不一样。
- 按内容供给方式分:手工編輯的頁面和程序批量生成的頁面,值得分開看。
分层不用追求精细,能区分出“這几類頁面的處境不一样”就够了。层數太多,每层样本太少,反而看不出结论。
每层抽多少,核對哪几件事
每一层抽 10 到 20 個 URL,通常已经能看出趋势。样本從哪来?可以優先從站内連結、内鏈结构、sitemap 里各取一部分,尽量覆盖不同入口,而不是全部取自首頁導航。
對每個样本,建议核對三件事,顺序上從抓取到索引再到内容:
- 抓取情况:日誌里有没有搜尋引擎的訪問记錄,返回的狀態碼是什么,抓取频率是持續的還是只有一两次。這一步回答問题:蜘蛛到底来没来。
- 索引狀態:用站点查询或 URL 检查工具看這個 URL 是否有索引结果,同时確認頁面的 canonical 指向哪里,是否指向了自己。這一步回答問题:抓取之後有没有進入索引。
- 一致性:索引里呈現的标题、摘要,和目前頁面是否一致;如果索引的是舊版本,說明還没重新抓取或刷新。這一步回答問题:索引里的内容是不是目前的。
三件事分開看,比笼统判断“收錄了没有”更有用。抓取缺失、抓取但未索引、索引版本陈舊,對應的處理方向完全不同。
几種常见的誤判
- 把站点查询的數量当作收錄總量。它只是粗略估計,不同時間、不同查询方式的结果會有出入,拿它做同比环比很容易得出错誤结论。
- 把“抓取過”直接当成“已收錄”。日誌里出現訪問,只說明頁面被發現過,是否進入索引是另一回事。
- 样本全来自浅层頁面。如果样本都取自首頁和導航,等于只测了最容易收錄的那部分,深层頁面的問题會被掩盖。
- 只抽新頁面。老頁面的索引回收同样是收錄健康度的一部分,只盯着新上线的内容,會漏掉這類信号。
- 观察窗口太短。刚提交或刚改動的頁面,短時間内没有出現在索引里属于正常現象,據此下结论容易誤判。
什么时候值得扩大到全量核對
抽样是筛查,不是终点。当某一层的样本普遍異常,比如整個栏目的頁面都没有抓取记錄,或者某類模板的頁面索引狀態全部為空,這时候再對這一层做全量核對才有意义。反過来,如果各层样本表現接近,說明問题不在收錄环节,繼續扩大核對范围收益不大。
收錄狀態本质上是動態的,抽样核對的目的是尽快找到問题的邊界,而不是给出一份精确的統計报表。
把核對结果按层记錄下来,标注每层的問题是抓取不足、索引缺失還是内容不一致,下次再查时就有了對比基准。這比每次重新翻一遍索引报告要省事得多。