做收錄核對时,很多人的第一反應是在搜尋框里敲一個 site: 查询,看它返回的數字,然後拿去和站長平台里的收錄數對比。结果往往差一大截,于是開始怀疑是不是掉了、是不是被處理了。其實在動手排查之前,先接受一個前提會更省事:這两個數字本来就不是同一套口径算出来的,差得多是常態,能對上反而是巧合。
一、两個數字分別是怎么来的
site: 查询返回的通常是一個估算值。搜尋引擎在處理這類查询时,一般不把所有匹配 URL 全部遍歷一遍再數给你看,而是基于索引分片做采样與近似,给出一個接近的數量級。它還會受查询词、訪問入口、訪問地区、当时索引合並進度的影响。所以它更适合用来判断“有没有量級上的異常”,而不适合拿来算精确的收錄率。
站長平台里的數字来自索引库的統計口径,一般在固定時間点匯總,並且會把 URL 拆成“已發現”“已抓取但未编入索引”“已编入索引”等不同狀態。它的判定規則、更新時間和統計范围(是否含子域、是否把 http 與 https 算成两套)都可能與 site 查询不同。
二、site 查询本身有哪些不确定
- 采样與近似:量越大誤差越明顯,小站可能數量級對得上,大站差几萬條並不稀奇。
- 查询词影响:在 site: 後面再加词,返回的是子集,數字自然更小。
- 入口不一致:不同地区、網頁版與移動端,落到不同資料中心,看到的數字可能不同。
- 變体合並:同一内容的多個 URL 版本被合並展示时,算一條還是按原始 URL 算,並没有统一说法。
- 時間点错位:你查的时刻如果正好卡在索引批量更新前後,數字會跳動。
三、真正值得核對的是三種狀態
與其纠结两個總量數字,不如按狀態逐段核對,把問题定位到具体环节。
- 已發現:URL 通過外鏈或 sitemap 進来了,但還没排上抓取。這類問题通常出在内鏈深度和抓取预算分配上。
- 已抓取但未编入索引:蜘蛛来過了,内容也拿到了,但索引层判断價值不足。這时要回到頁面质量、重复度、正文是否可讀這几件事上。
- 已编入索引:能進這個狀態,說明基础條件已经過了,後面的問题属于展示與排序层面。
把三段的量分別记下来,比记一個總和有用得多。總和變化时,你至少能立刻分辨是“發現”變差了,還是“编入”變嚴了。
四、數字對不上时,按這個顺序查
- 先確認两邊統計范围是否一致:协议、子域、尾斜杠、大小寫、是否带參數,是否同一批 URL。
- 確認時間点,站長平台的資料通常有延迟,先看它的資料截止到哪一天。
- 挑几條具体 URL 做样本,在两個地方分別查,看差异是普遍現象還是集中在少數頁面。
- 如果差异集中在某類頁面,比如列表、标簽、篩選结果,優先怀疑 URL 變体過多導致的去重與合並。
- 只有当样本差异成規模、方向又一致时,再去怀疑抓取层或索引层出了異常。
五、几句提醒
site 查询可以当随手一看的体温計,但不适合寫進报表当考核指标。它既不能證明站点被處理了,也不能證明收錄變好了。更稳的做法是维護一份自己可控的 URL 清單,按上面三種狀態定期抽样核對,看趋势而不是看單点數字。
數字對不上,多數时候不是出了故障,而是两把尺子量的是不同的東西。先把尺子對齐,再谈有没有問题。