網站收錄

site 查询數字忽高忽低:三種收錄口径別混用

site 查询、Search Console 索引报告和服務器日誌,是三套不同的收錄口径。數字對不上往往不是故障,而是統計方式差异。本文拆解三者区別,给出一套固定口径、看趋势、抽样驗證的排查顺序,並說明哪些波動可以先观察、哪些需要尽快處理。

網站收錄

site 查询數字忽高忽低:三種收錄口径別混用

很多人判断收錄情况,第一反應是在搜尋框里敲一次 site 查询,數字涨了就放心,掉了就立刻去改内鏈、改模板、調 robots。實际上,site 返回的是一個估算值,它和 Search Console 报告的索引量、服務器日誌里的抓取量,是三套不同的口径。三個數字對不上是常態,長期完全一致反而少见。

先把三種口径分清

site 查询:抽样估算,带地域和時間差

site 的數字受查询节点、地域、時間点影响,同一天不同時間查都可能不一样。它還會做去重和抽样,所以更适合看量級和趋势,不适合当成精确清單。想確認某個具体 URL 在不在索引里,直接搜它的完整标题或一段獨有句子,比看總量更有意义。

索引报告:区分“已编入索引”和“已抓取但未编入索引”

索引报告里的“已编入索引”才是真正進了索引的頁面數,而“已抓取——尚未编入索引”说的是抓過了但没被收錄。這两項性质完全不同:前者更偏索引侧問题,後者多半與内容质量、重复度或價值判断有關。把两者加在一起当收錄量,是最常见的誤讀。

服務器日誌:只說明抓取,不說明收錄

日誌里蜘蛛来過、返回 200,只能證明抓取發生過;是否進索引,要另外驗證。抓取量突然變多,可能是它在反复確認某個不稳定的頁面,未必是好事。

三個數字對不上,通常出在這些地方

  • 协议和域名變体:http、https、www、不带 www 在某些查询里可能被分開統計。
  • 索引分片與更新延迟:索引不是實时同步的,一段時間内的數字波動属于正常刷新。
  • 重复内容折叠:被判定重复而折叠的 URL,在不同口径里可能一邊算一邊不算。
  • 抓取與收錄的時間差:日誌統計的是爬虫行為,索引統計的是處理结果,中間隔着一整條管线。

一套不容易被數字带偏的排查顺序

  1. 固定口径:统一域名變体、统一查询方式、统一時間窗口,再比較數字。
  2. 看趋势不看單点:连續记錄四到八周,比两天的涨跌可靠得多。
  3. 抽样驗證:從各頁面類型里各抽若干 URL,手工確認是否真的在索引中。
  4. 對照日誌:抓取量和索引量同步下降,更像抓取层問题;抓取正常而索引下降,往内容與規范化方向查。
  5. 检查變更:這段時間内是否動過 canonical、noindex、robots、模板或 URL 结构。

哪些波動可以先不管

  • 總量在百分之几以内来回浮動,頁面類型分布没有明顯變化。
  • 只是新發布的頁面還没被處理,老頁面保持稳定。
  • 對應的是同一批低價值 URL 反复進出。

需要尽快處理的則是另一類:某一類頁面整体消失、索引量持續多周下行、日誌里出現大量異常狀態碼。

收錄數字是观察工具,不是考核指标。先確認自己在看哪一種口径,再决定要不要動手。

實操上,建议维護一份最简單的收錄台帳:每周固定時間记錄 site 量級、索引报告里的主要分類、日誌抓取量,並按頁面類型分開记。資料放在一起看,才不容易被單一數字牵着走。