網站收錄

不同工具查出的收錄數對不上:先分清口径,再决定改什么

站長平台、site 查询和第三方工具给出的收錄數字经常互相矛盾,這多半是統計口径不同,而不是站点出了問题。本文拆解三套常见口径的差异来源,给出一套自查顺序,帮助判断哪些差异可以忽略、哪些才值得動手處理。

網站收錄

不同工具查出的收錄數對不上:先分清口径,再决定改什么

做收錄排查时,最容易踩的坑是拿两個不同来源的數字做减法:站長平台顯示一萬,第三方工具顯示六千,site 查询又只给一個模糊区間,于是開始怀疑站点被降權。多數情况下這不是站点變差了,而是几套數字本来就在數不同的東西。

先分清三套常见口径

搜尋引擎後台的索引資料

站長平台展示的是搜尋引擎自己認帳的索引情况,通常按“已编入索引”“已發現未抓取”“已抓取未编入索引”等狀態分類。它的特点是准确度相對高,但更新有延迟,而且只覆盖自己能看到的范围,比如子域、协议版本可能分開統計。

site 查询给出的结果

site 查询本质上是估算值,不是精确計數。搜尋引擎會為了性能做抽样,最後一頁的數字经常前後跳動,同一站点在不同時間、不同地区查询结果也可能有出入。它适合看趋势和大致量級,不适合当成绝對值来做决策。

第三方工具的統計

第三方工具多數依靠采样、歷史資料库或自有爬虫推算,覆盖范围和更新节奏與搜尋引擎不同步。它對你和竞品用同一套逻辑,所以用来做横向對比比較合适,用来判断自己站点是否“掉了三千條”就不太靠谱。

數字差异通常来自這几個地方

  • 估算與實测的区別:site 是估算,後台是實测,两者天生不相等。
  • 更新延迟:新頁面编入索引、舊頁面被移除,各資料源的反應速度不同,差几天很正常。
  • 過滤規則:近似重复、參數頁、低價值頁面可能被抓取但不進入可检索的索引,統計口径不同就會差一截。
  • URL 归一方式:带與不带 www、http 與 https、末尾斜杠、大小寫,在不同工具里可能被合並,也可能被当成两條。
  • 范围邊界:子域、多語言目錄、CDN 域名算不算在内,各家預設設定不一样。

什么时候可以放過,什么时候该動手

如果两個數字差在百分之十几以内,而且趋势方向一致,基本可以忽略。真正值得動手的信号是:後台顯示“已發現未抓取”持續增長、重要栏目頁在後台查不到、索引量连續几周單向下滑,或者某個改版前後出現断崖式變化。這些是站点侧的問题,和工具口径無關。

判断标准不是“哪個數字更高”,而是“這個變化有没有對應的站点動作”。没有動作却有大變化,才需要查。

一套可用的自查顺序

  1. 先固定一個主口径,建议用搜尋引擎後台,把它当作唯一的事實来源。
  2. 確認查询范围一致:是否包含子域、是否区分协议、是否按目錄篩選。
  3. 對差异最大的那一批 URL 抽样,人工打開看它們是否真的能被搜到。
  4. 检查抽样頁面是否存在 canonical 指向別處、noindex、參數重复等常见問题。
  5. 把差异按類型归類,而不是按數量纠结:是延迟、是過滤,還是真的没被收錄。
  6. 只對確認有問题的那一類動手,改完观察两到四周再對比,不要同时改多項。

落地建议

與其每天對比不同工具的數字,不如固定一張自己的收錄表:選几十個有代表性的頁面,包括首頁、栏目頁、重要詳情頁和新增内容,每周记錄一次它們在後台的狀態。样本量不大,但趋势足够清晰,也不會被第三方工具的估算波動带着走。收錄問题多半是慢變量,稳定观察比频繁換工具更有用。