做收錄自查时,很多人的第一反應是在搜尋框里敲一個 site:域名,看一眼返回的數字,再打開 Search Console 的索引报告對比,發現两個數差了好几倍,于是開始怀疑站点是不是出了問题。其實這两個數字從一開始就不是同一個指标,把它們放在一起比較,只會带来没必要的焦虑。
三個常见數字,口径完全不同
- site: 查询返回的條數:這是搜尋引擎给出的粗略估算,會随查询词、查询地区、時間点變化,同一個域名隔几分钟再查,數字也可能不一样。它既不是精确的收錄量,也不代表這些 URL 都能拿到流量。
- 索引报告里的“已编入索引”:統計的是被判定為可展示的規范頁數量,通常更接近站点實际的有效頁面規模,但它有統計延迟,也不把被折叠掉的變体 URL 算進去。
- 第三方工具的收錄估算:多數基于抽样或自有資料源推算,用来看量級和趋势可以,具体數字不必較真。
三個數字服務的目的不一样:site: 用于快速確認某個 URL 有没有進索引,索引报告用于看整体结构和問题分布,第三方工具用于看長期趋势。混用就會得出错誤结论。
site: 的數字為什么经常偏小
结果是抽样呈現的
搜尋引擎不會為你的一次查询遍歷整個索引,返回的只是匹配结果的一個子集,還會做去重和相似结果合並。所以 site: 查出来的條數普遍低于真實收錄量,頁面越多、模板越相似,偏差越明顯。
容易被過滤掉的頁面類型
- 内容高度相似的分頁、篩選頁、參數頁,展示时會被大量折叠;
- 正文過短或主要由列表构成的頁面;
- 同一站点下被認為價值較低的目錄。
這些頁面里有一部分确實進了索引,只是不會出現在 site: 的结果里。反過来,有些頁面顯示在结果中,点進去却已经被替換成別的規范頁,這也是常见情况。
想確認某批 URL 的真實狀態,用這三種方法
- 逐條核對單個 URL:把完整地址贴進搜尋框,看是否返回该頁面本身而不是站内其他頁面;再配合 URL 检查工具,確認它被判定為哪個規范頁、目前處于什么狀態。
- 看索引报告的分组:已编入索引、已抓取但尚未编入索引、已發現但尚未抓取、重复網頁且 Google 選擇了不同的規范頁,這几個分组分別對應不同的問题,比一個總數信息量大得多。
- 做小样本抽查:從 sitemap 里随机抽 30 到 50 條 URL,逐條查狀態,算出大致比例。這個比例比任何總數都更能反映真實情况,也更容易复現和跟踪。
數字波動时,先排除這些因素
- 站点近期批量上线或下线了頁面,收錄總量自然會跟着變;
- 改版、URL 结构調整後,索引库需要時間替換舊地址;
- 索引报告本身有延迟,通常滞後數天到數周;
- 查询时所在的地区、語言設定不同,返回结果也會有差异。
把這些因素排除之後如果還有明顯下滑,再去查具体頁面,而不是對着總數字反复刷新。
把注意力從總數挪到分批跟踪
更實用的做法是放弃追赶一個總數,改為按批次管理:把新發布的 URL 记成一批,定期抽查這批里有多少進了索引、有多少停在“已抓取未编入索引”。這样能看出的是趋势和具体問题,而不是一個每天都在變、又说不清含义的數字。
收錄數字是结果,不是目标。它更像体温計,用来發現問题,而不是用来追高。
如果某一批頁面的收錄比例持續偏低,再去查内鏈入口、内容差异度、規范頁設定這些具体环节。數字不一致本身不是問题,把它当成問题才是。