網站收錄

site 查询的數字和站長平台差一大截:先分清两把尺子各在量什么

site 查询返回的是估算值,站長平台的索引統計是另一套口径,两者差得多属于常態。本文說明數字差异的常见来源,並给出按“已發現、已抓取未编入、已编入”三種狀態逐段核對的顺序,帮助判断是范围没對齐還是真的出了問题。

網站收錄

site 查询的數字和站長平台差一大截:先分清两把尺子各在量什么

做收錄核對时,很多人的第一反應是在搜尋框里敲一個 site: 查询,看它返回的數字,然後拿去和站長平台里的收錄數對比。结果往往差一大截,于是開始怀疑是不是掉了、是不是被處理了。其實在動手排查之前,先接受一個前提會更省事:這两個數字本来就不是同一套口径算出来的,差得多是常態,能對上反而是巧合。

一、两個數字分別是怎么来的

site: 查询返回的通常是一個估算值。搜尋引擎在處理這類查询时,一般不把所有匹配 URL 全部遍歷一遍再數给你看,而是基于索引分片做采样與近似,给出一個接近的數量級。它還會受查询词、訪問入口、訪問地区、当时索引合並進度的影响。所以它更适合用来判断“有没有量級上的異常”,而不适合拿来算精确的收錄率。

站長平台里的數字来自索引库的統計口径,一般在固定時間点匯總,並且會把 URL 拆成“已發現”“已抓取但未编入索引”“已编入索引”等不同狀態。它的判定規則、更新時間和統計范围(是否含子域、是否把 http 與 https 算成两套)都可能與 site 查询不同。

二、site 查询本身有哪些不确定

  • 采样與近似:量越大誤差越明顯,小站可能數量級對得上,大站差几萬條並不稀奇。
  • 查询词影响:在 site: 後面再加词,返回的是子集,數字自然更小。
  • 入口不一致:不同地区、網頁版與移動端,落到不同資料中心,看到的數字可能不同。
  • 變体合並:同一内容的多個 URL 版本被合並展示时,算一條還是按原始 URL 算,並没有统一说法。
  • 時間点错位:你查的时刻如果正好卡在索引批量更新前後,數字會跳動。

三、真正值得核對的是三種狀態

與其纠结两個總量數字,不如按狀態逐段核對,把問题定位到具体环节。

  1. 已發現:URL 通過外鏈或 sitemap 進来了,但還没排上抓取。這類問题通常出在内鏈深度和抓取预算分配上。
  2. 已抓取但未编入索引:蜘蛛来過了,内容也拿到了,但索引层判断價值不足。這时要回到頁面质量、重复度、正文是否可讀這几件事上。
  3. 已编入索引:能進這個狀態,說明基础條件已经過了,後面的問题属于展示與排序层面。

把三段的量分別记下来,比记一個總和有用得多。總和變化时,你至少能立刻分辨是“發現”變差了,還是“编入”變嚴了。

四、數字對不上时,按這個顺序查

  1. 先確認两邊統計范围是否一致:协议、子域、尾斜杠、大小寫、是否带參數,是否同一批 URL。
  2. 確認時間点,站長平台的資料通常有延迟,先看它的資料截止到哪一天。
  3. 挑几條具体 URL 做样本,在两個地方分別查,看差异是普遍現象還是集中在少數頁面。
  4. 如果差异集中在某類頁面,比如列表、标簽、篩選结果,優先怀疑 URL 變体過多導致的去重與合並。
  5. 只有当样本差异成規模、方向又一致时,再去怀疑抓取层或索引层出了異常。

五、几句提醒

site 查询可以当随手一看的体温計,但不适合寫進报表当考核指标。它既不能證明站点被處理了,也不能證明收錄變好了。更稳的做法是维護一份自己可控的 URL 清單,按上面三種狀態定期抽样核對,看趋势而不是看單点數字。

數字對不上,多數时候不是出了故障,而是两把尺子量的是不同的東西。先把尺子對齐,再谈有没有問题。