做站点运营的人经常遇到這样一幕:站長平台顯示已收錄两萬條,site 指令查出来只有几千條,日誌里蜘蛛抓過的 URL 又是另一個數量級。三個數字對不上,很容易让人怀疑站点出了大問题。多數情况下不是谁統計错了,而是三方統計的根本不是同一件事。
三個數字各在統計什么
站長平台的索引量
它對應的是“已编入索引、有资格參與展現”的 URL 數量,通常是估算和平滑處理後的结果。更新有延迟,也不保證每一條都能單獨查得到。它的價值在趋势,不在绝對值。
site 指令的返回數
site 返回的是一個估算值,會随查询节点、時間点、查询寫法以及是否加目錄而波動。同一站点上午和下午差出一半並不罕见。它适合做抽样驗證,不适合当收錄基准。
日誌里的抓取數
抓取和索引是两個环节。日誌记錄的是蜘蛛来過多少次、抓走多少 URL,其中相当一部分本来就不该進索引,比如參數頁、重复頁、無實质内容的頁面。拿抓取量對比收錄量,相当于拿進货單對比上架商品數,天生對不上。
核對差异的四個步骤
- 统一時間窗口。日誌取最近七天的完整資料,平台資料取同一時間段,避免拿今天的抓取量和上個月的收錄量作比較。
- 统一域名與协议版本。http、https、www、非 www,以及子域和移動端域名,如果分別算在两套口径里,差值會凭空出現。
- 抽样比對具体 URL。從日誌里挑二十到五十條已抓取的 URL,逐個查收錄狀態,看是确實没收錄,還是收錄了但統計里看不到。這一步能把笼统的差异落到具体頁面上。
- 区分抓取、索引、展現。被抓過不等于被索引,被索引不等于有展現。三個环节各自有各自的過滤條件,混在一起看只會得到一团乱麻。
三類常见的“假差异”
- 带參數的 URL。跟踪參數、排序參數生成的大量變体,有的被合並統計,有的被單獨計算,差額往往来自這里。
- 模板類頁面。分頁、标簽、篩選頁在不同工具里的归属規則不一致,容易造成几千條的出入。
- 統計延迟。平台資料往往滞後數天到两周,刚發布的頁面在平台里查不到,属于正常現象。
什么样的差异才值得動手
如果只是某一次查询對不上,通常可以放過。真正需要處理的是方向上的一致性變化:索引量连續两到四周下滑,同时日誌顯示抓取正常、返回碼正常;或者新增内容長期抓取正常却始终不進索引。前者要查内容质量與重复問题,後者要查頁面本身是否存在阻碍索引的設定。
反過来,索引量正常而 site 查不到,多半只是估算問题,不必為了一個查询结果去改站。
收錄數字是估算,趋势才是信号。單個數字的绝對值參考意义有限,连續的方向變化才值得投入排查成本。
把核對變成固定動作
與其每次看到差异就慌,不如把它變成每周一次的固定動作:记錄平台索引量、抽样若干 URL 的收錄狀態、統計日誌里的抓取分布。坚持几周之後,你會知道自己的站点“正常”是什么样子,任何偏离都會第一時間被识別出来,而不是等到流量掉了才開始翻日誌。