網站收錄

收錄數對不上別急着补内容:先把三套統計口径對齐

站内查询、索引覆盖报告和抓取日誌给出的收錄數字经常差好几倍,多半不是資料出错,而是統計口径不同。本文把三套資料各自的含义、時間窗口、URL 归一方式和狀態定义逐條對齐,让你在動手改内容之前先拿到一個可比較、可复現的收錄基线。

網站收錄

收錄數對不上別急着补内容:先把三套統計口径對齐

收錄核對时最常见的场景:站内查询顯示 3 萬,索引覆盖报告寫 1.2 萬,日誌里半個月出現的獨立地址有 5 萬。三個數字都不假,但分母不同、時間窗口不同、對“收錄”的定义也不同。直接拿其中一個下结论,後面的動作基本都會跑偏:按 3 萬判断是“内容太多要收敛”,按 1.2 萬判断是“頁面质量不行要改模板”,方向正好相反。

三套資料分別在说什么

站内查询與站長工具:抽样後的代表地址

站内查询给的是估算值,會按目錄、模板合並同類項,同一個模板下的相似頁面往往只留一個代表。它适合看结构和覆盖方向,不适合当精确計數。

索引覆盖报告:按原因分组的结果

报告的强項是分组——已编入索引、已發現但未编入、已抓取但未编入、重复網頁等。每一组的判定依據不同,把不同组直接相加没有意义。

抓取日誌:請求层面的原始记錄

日誌记錄的是“来過”,不是“收過”。同一個地址可能被反复抓取多次,也可能被不同 UA 抓取,去重前統計出的獨立地址數會明顯偏大。

對齐口径要動的四件事

  1. 時間窗口:日誌是過去若干天的抓取,索引报告是某個时点的快照,站内查询還有缓存延迟。三者至少要鎖到同一周,否則新老地址會互相干扰。
  2. URL 归一:协议、www、末尾斜杠、大小寫、跟踪參數,先按统一規則归一,否則同一個頁面會被算成两三個地址。
  3. 狀態定义:明确什么叫“已收錄”——是能被查到、能返回正文,還是只需要在报告里出現在某個分组。定义不同,數字自然不同。
  4. 分母:確認算的是全部地址、sitemap 里的地址,還是内鏈可達的地址。分子分母不同源,算出来的收錄率没有可比性。

把差异落到具体地址上

口径對齐之後,如果還有差异,才值得進入下一步。做法很简單:三份列表都归一成同一套 URL 格式,做一次交叉比對,把地址分成四類——

  • 三份都有:稳定的已收錄頁,作為基线。
  • 日誌有、报告無:抓了没收,重点看頁面质量和重复情况。
  • 报告有、日誌無:可能是老地址靠歷史信号撑着,需要確認是否還在维護。
  • 只有站内查询有:多半是合並展示的代表頁,別当成獨立收錄。

分類之後,每一類對應不同的處理動作,比笼统地说“收錄不達标”要具体得多。

先對齐口径,再谈優化。拿两個不同口径的數字互相比,得到的结论往往只是統計噪声。

几個容易忽略的点

  • 用移動端 UA 和桌面 UA 抓取,看到的返回可能不同,日誌統計要分開看。
  • 报告里的分组會随時間變化,同一個頁面這周在“已發現”、下周進“已编入”,比較时要用同一时点。
  • 站点改版、迁移、批量調整模板之後,歷史基线會失效,最好重新取一次基线再比。

口径這件事不产出内容,但它决定了後面所有判断的可信度。花半天把三套資料對齐,往往比急着改十版模板更省事。