做站点运营的人常遇到一個困惑:同一批頁面,用 site 查询看到的數量、搜尋资源平台索引报告里的“已编入索引”數、以及服務器日誌中的抓取條數,三者经常差出好几倍。遇到這種差距,先別急着判断“收錄出問题了”,多數情况下是統計口径不同造成的错觉。
第一步:先明确你要回答哪個問题
不同的問题對應不同的資料来源,混用就會得出错誤结论:
- 頁面進了索引没有?看單個 URL 的索引狀態,或索引报告里的狀態分類。
- 整站收錄比例高不高?需要把已编入索引數除以可收錄的規范 URL 總數,而不是除以站点全部 URL。
- 抓取是否正常?看日誌里的抓取频次與狀態碼分布,這和收錄是两件事。
第二步:三份資料各自在说什么
site 查询:估算值,不是資料库導出
它返回的是估算结果,通常會截断展示,並且随查询地区、語言、设备不同而變化。适合做粗判断,不适合当作收錄量的精确統計。
索引覆盖率报告:按狀態分類的頁面集合
這份报告統計的是搜尋引擎自己判定的頁面狀態,包含“已编入索引”和各類“未编入索引”的原因。它有資料延迟,且只覆盖它認為属于该站点的規范 URL。
服務器日誌:抓取行為,不等于收錄
日誌记錄的是“谁在什么时候来抓過哪個地址”,抓取成功只說明頁面被訪問過,不說明被收錄。反過来,一個頁面没有被抓取,也未必是異常,可能只是還没轮到。
第三步:统一口径的四個動作
- 固定時間窗口。三份資料取同一周或同一天,避免拿上個月的报告對比這個月的日誌。
- 規范化 URL。把协议、主机名大小寫、末尾斜杠、預設端口、跟踪參數统一成一種寫法後再去重,否則同一頁面會被算成多個。
- 明确統計對象。决定這次只看 HTML 正文頁,還是把列表頁、分頁、附件一起算進去。對象不同,分母就不同。
- 固定查询入口。site 查询尽量在同一地区、同一设备條件下進行,减少展示层面的干扰。
第四步:抽样交叉驗證
數字對齐之後,從三個来源各抽几十個 URL,逐個確認它在索引报告里的狀態、在日誌里的抓取记錄、以及用精确查询能否找到。抽样比看總數更能說明問题:如果抽到的頁面大多狀態正常,那總數上的差距多半来自口径而不是故障。
几種常见的“對不上”及解释
- site 數遠小于索引报告數:通常是展示层截断或估算誤差,不代表頁面没被收錄。
- 日誌抓取很多,索引數不涨:抓取不等于收錄;也可能是抓取被參數頁、重复地址消耗掉了,值得检查 URL 生成方式。
- 报告里“已编入索引”不少,但几乎搜不到:這些頁面可能确實在索引里,只是没有匹配到你的查询词,属于展示與排序层面的事。
- 索引數在一段時間内持續下滑:優先看是不是有大批頁面被判為重复或低质,再回头看内容與 URL 结构。
把 site 查询的數字当作收錄 KPI,是很多誤判的起点。它给的是印象,不是帳本。
什么时候才值得動手排查
只有在口径统一、時間窗口一致、抽样驗證之後依然存在的差距,才值得当成問题来處理。這时可以把范围收窄到具体的 URL 分组,逐個核對狀態碼、robots 規則、canonical 指向和内容质量,而不是一上来就改全站。
總结成一句话:先让三份資料说同一種語言,再判断收錄好不好。數字對不上是常態,口径對不上才是問题。