網站收錄

site 语法和索引报告對不上:查收錄數字时该信谁

site: 查询的數字、Search Console 的索引报告、第三方工具的估算,三者口径完全不同,互相比較只會制造焦虑。本文拆解這三個數字分別代表什么,给出抽样驗證真實收錄狀態的方法,以及數字波動时该先排除哪些干扰因素。

網站收錄

site 语法和索引报告對不上:查收錄數字时该信谁

做收錄自查时,很多人的第一反應是在搜尋框里敲一個 site:域名,看一眼返回的數字,再打開 Search Console 的索引报告對比,發現两個數差了好几倍,于是開始怀疑站点是不是出了問题。其實這两個數字從一開始就不是同一個指标,把它們放在一起比較,只會带来没必要的焦虑。

三個常见數字,口径完全不同

  • site: 查询返回的條數:這是搜尋引擎给出的粗略估算,會随查询词、查询地区、時間点變化,同一個域名隔几分钟再查,數字也可能不一样。它既不是精确的收錄量,也不代表這些 URL 都能拿到流量。
  • 索引报告里的“已编入索引”:統計的是被判定為可展示的規范頁數量,通常更接近站点實际的有效頁面規模,但它有統計延迟,也不把被折叠掉的變体 URL 算進去。
  • 第三方工具的收錄估算:多數基于抽样或自有資料源推算,用来看量級和趋势可以,具体數字不必較真。

三個數字服務的目的不一样:site: 用于快速確認某個 URL 有没有進索引,索引报告用于看整体结构和問题分布,第三方工具用于看長期趋势。混用就會得出错誤结论。

site: 的數字為什么经常偏小

结果是抽样呈現的

搜尋引擎不會為你的一次查询遍歷整個索引,返回的只是匹配结果的一個子集,還會做去重和相似结果合並。所以 site: 查出来的條數普遍低于真實收錄量,頁面越多、模板越相似,偏差越明顯。

容易被過滤掉的頁面類型

  • 内容高度相似的分頁、篩選頁、參數頁,展示时會被大量折叠;
  • 正文過短或主要由列表构成的頁面;
  • 同一站点下被認為價值較低的目錄。

這些頁面里有一部分确實進了索引,只是不會出現在 site: 的结果里。反過来,有些頁面顯示在结果中,点進去却已经被替換成別的規范頁,這也是常见情况。

想確認某批 URL 的真實狀態,用這三種方法

  1. 逐條核對單個 URL:把完整地址贴進搜尋框,看是否返回该頁面本身而不是站内其他頁面;再配合 URL 检查工具,確認它被判定為哪個規范頁、目前處于什么狀態。
  2. 看索引报告的分组:已编入索引、已抓取但尚未编入索引、已發現但尚未抓取、重复網頁且 Google 選擇了不同的規范頁,這几個分组分別對應不同的問题,比一個總數信息量大得多。
  3. 做小样本抽查:從 sitemap 里随机抽 30 到 50 條 URL,逐條查狀態,算出大致比例。這個比例比任何總數都更能反映真實情况,也更容易复現和跟踪。

數字波動时,先排除這些因素

  • 站点近期批量上线或下线了頁面,收錄總量自然會跟着變;
  • 改版、URL 结构調整後,索引库需要時間替換舊地址;
  • 索引报告本身有延迟,通常滞後數天到數周;
  • 查询时所在的地区、語言設定不同,返回结果也會有差异。

把這些因素排除之後如果還有明顯下滑,再去查具体頁面,而不是對着總數字反复刷新。

把注意力從總數挪到分批跟踪

更實用的做法是放弃追赶一個總數,改為按批次管理:把新發布的 URL 记成一批,定期抽查這批里有多少進了索引、有多少停在“已抓取未编入索引”。這样能看出的是趋势和具体問题,而不是一個每天都在變、又说不清含义的數字。

收錄數字是结果,不是目标。它更像体温計,用来發現問题,而不是用来追高。

如果某一批頁面的收錄比例持續偏低,再去查内鏈入口、内容差异度、規范頁設定這些具体环节。數字不一致本身不是問题,把它当成問题才是。