網站收錄

收錄數字對不上:後台报告、site 查询與抓取日誌的口径差异

後台索引报告、site 查询和抓取日誌经常给出三個不一样的數字。它們統計的對象本来就不同:一個看索引库,一個看可检索结果,一個只看訪問记錄。先把口径對齐,再按時間差、版本合並、抓取與收錄的界限逐項核對,才能判断站点到底出了什么問题。

網站收錄

收錄數字對不上:後台报告、site 查询與抓取日誌的口径差异

做收錄統計时,几乎每個人都會遇到同一個問题:站長平台後台顯示已编入索引 X 條,site 查询给出 Y 條,抓取日誌里蜘蛛訪問過的 URL 又是 Z 條。三個數字往往差得很遠,于是有人開始怀疑是不是被降權,或者怀疑工具坏了。多數情况下,問题出在口径——這三個數字統計的根本不是同一件事。

三個口径分別在數什么

索引报告:以搜尋引擎自己的索引库為准,通常按「已编入索引」「已抓取但未编入索引」「已發現」「已排除」等狀態分组。它最接近「收没收」,但有更新延迟,並且會把同一内容的多個版本合並計算。

site 查询:這是检索结果层面的估算值,只反映「現在能搜出来的頁面」。它會受查询触發方式、資料中心、结果去重、個性化等因素影响,短時間内上下浮動很正常,不适合当成精确計數。

抓取日誌:记錄蜘蛛實际訪問的 URL 和狀態碼,只能證明「来過」,不能證明入库。日誌里 200 响應很多的站点,索引量原地不動的例子並不少见。

先确定你要回答的是哪個問题

  • 想知道有多少頁面進了索引:看索引报告,別用 site 數字下结论。
  • 想知道某個 URL 現在能不能被搜到:用 URL 检查類工具,再配合 site 加具体 URL。
  • 想知道頁面有没有被爬:看日誌,配合服務器狀態碼。
  • 想知道抓取是否顺利:日誌加狀態碼分布,而不是收錄數字。

差异的常见来源,按核對顺序排

  1. 時間差。索引更新不是即时的,抓取、入库、可检索之間通常隔一段時間。先看對比的两個數字是不是同一时刻取的。
  2. 版本合並。协议、大小寫、尾斜杠、參數不同但内容相同的 URL,在报告里可能被合並成一條,在日誌里却是多條,于是數字天然對不上。
  3. 抓取不等于收錄。日誌里的 200 只說明抓到了,頁面质量、内容重复度、结构完整度都會影响是否编入索引。
  4. 收錄不等于可见。進了索引也可能因為查询词、地域、结果去重而不被展示,site 查询數字偏小属于正常現象。
  5. 統計范围不同。报告可能只覆盖某個目錄或子域,站点地图只包含你提交的部分,日誌則包含所有被訪問的路径。范围没對齐,比較就没有意义。
抓取日誌回答「来過没有」,索引报告回答「收没收」,site 查询回答「現在搜不搜得到」。把問题對應到正确的口径,再谈數字差多少。

實操:把差异收敛到可解释

  • 固定一個基准口径,例如以索引报告為准,其他數字只作參考。
  • 抽一批具体 URL,逐個查索引狀態和最近一次抓取時間,比整体數字更容易看出規律。
  • 记錄對比的時間点,隔几天再看一次,避免被正常波動誤導。
  • 检查 robots、canonical 和狀態碼,確認没有把頁面挡在抓取或收錄之外。
  • 發現大片「已發現未抓取」或「已抓取未编入」,再回头處理入口信号與頁面质量。

几個容易誤判的情形

  • 抓取量涨、收錄没涨:多半是新 URL 增多但质量不够,或者大量是參數、篩選類頁面。
  • 收錄數涨、流量没涨:新增收錄的可能是不带搜尋需求的頁面,與曝光没有直接關系。
  • 數字突然跳變:先排除报告口径調整、資料延迟,再考虑站点自身變化。

收錄數字只是线索,不是结论。把三個口径的問题分清,再按上面的顺序逐項核對,通常能把「對不上」變成几條具体、可處理的事項。