網站收錄

收錄數字為什么對不上:Search Console、site 查询與日誌的口径差异

同一個站点,Search Console、site: 查询和服務器日誌常常给出三個完全不同的數字。它們統計的對象本来就不是一回事:一個是已编入索引的規范化 URL,一個是搜尋结果條數的粗略估算,一個只是抓取請求记錄。本文說明三種口径各自在數什么、為什么會差、该用哪種方式對比,以及真正排查时该按什么顺序看。

網站收錄

收錄數字為什么對不上:Search Console、site 查询與日誌的口径差异

做收錄自查时,很多人會卡在同一個問题上:三個地方看到三個不同的數字。Search Console 说已编入索引一萬條,site: 查询顯示三千條,服務器日誌里被訪問的 URL 又是另一個量級。它們並不是互相矛盾,而是在數不同的東西。先把每個口径在數什么分清楚,後面的判断才不會走偏。

三種口径分別在數什么

Search Console 的頁面报告數的是“已编入索引的規范化 URL”,並且只覆盖你驗證過的那部分资源。被排除的頁面、被 canonical 合並掉的版本、robots 屏蔽的目錄,都不會計入這個數字。它還有明顯的更新延迟,几天到几周都算正常。

site: 查询返回的是搜尋结果的條數,是一個粗略估算值。它會随查询词寫法、查询地区、時間点而波動,同一個域名前後两次查询给出不同结果很常见。它适合用来看“量級”和“是否有異常”,不适合当作精确值来记錄。

服務器日誌记錄的是抓取請求。被反复抓取不等于被收錄,被抓取一百次的頁面可能一次都没進索引,而一個几乎不来的頁面也可能早就躺在索引里。日誌反映的是抓取行為,不是索引狀態。

第三方工具的數字来自它自己抓取或合作的索引样本,更新节奏和你實际提交的内容並不是同一套時間线。

一句话概括:日誌回答“来過没有”,site: 回答“大概有多少”,頁面报告回答“哪些被算進来了”。三個問题的答案本来就不會相等。

數字對不上的常见原因

  • 統計對象不同:抓取次數、索引條數、可展現條數、有效頁面數,是四個层面的東西。
  • 規范化合並:多個 URL 被归並到一個主版本後,頁面报告只按主版本計數,而日誌里每個變体都算一次。
  • 更新延迟:索引刷新、报告生成、日誌匯總三者時間窗不一致,跨口径對比必然错位。
  • 范围不同:子域名、目錄、多語言版本可能不在同一個资源分组里,site: 查询又往往把整個域名都算進来。

正确的對比方式

  1. 同一口径只比趋势:頁面报告和歷史頁面报告比,日誌和歷史日誌比,不要拿頁面报告去减 site: 的數字。
  2. 固定查询條件:site: 查询固定寫法、固定地区、固定時間点,只观察變化方向,不记錄绝對數值。
  3. 以分组為單位:按目錄或内容類型分组看收錄比例,比看全站總數更有意义,也更容易定位問题出在哪一块。
  4. 把口径寫下来:团队里约定每次自查用哪套指标,避免不同的人拿着不同的數得出相反的结论。

真正排查时的顺序

  1. 先明确要回答的問题:是“收錄總量掉了”,還是“某類頁面不進索引”,還是“抓取量異常”。問题不同,该看的报告不同。
  2. 用頁面报告看“已排除”的原因分布:這類頁面的占比變化,通常比總數變化更能說明問题。
  3. 用 URL 检查看單個頁面的實际狀態:挑几個代表性 URL,確認它目前是已编入索引、已抓取未编入索引,還是被排除。
  4. 用日誌確認抓取是否到達:如果日誌里连抓取都没有,那問题在 URL 發現或抓取环节,和索引無關。
  5. site: 只做粗看:用来確認域名整体還在,不作為结论依據。

容易被誤判的几種情况

  • 收錄數下降,但掉的是低價值頁面:部分聚合頁、參數頁被剔除後總數下降,實际有效收錄並没有變差。
  • 日誌量上涨,收錄没有上涨:抓取增加可能来自重定向鏈、參數组合或重复路径,不产生新的索引條目。
  • site: 數字来回跳:多數情况下只是估算值波動,连續观察一两周再判断更有依據。

收錄數字的價值不在精确,而在于變化方向和原因定位。把三種口径各自代表什么寫在自查清單里,每次用同一套方式记錄,才能看出真正的趋势,而不是被三個不同的數字来回牵着走。