網站收錄

三個地方看到的收錄數不一样:搜尋指令、後台报告和服務器日誌各在統計什么

搜尋指令、搜尋後台报告和服務器日誌经常给出三個不同的收錄數字。差异大多来自統計口径、時間窗口和規范化處理,而不是有人算错了。先弄清每個數字在數什么,再决定要不要排查,能避免把正常差异当成故障處理。

網站收錄

三個地方看到的收錄數不一样:搜尋指令、後台报告和服務器日誌各在統計什么

做收錄检查时,很容易遇到這種情况:搜尋指令查出来的數量、後台报告里的索引頁面數、服務器日誌里被蜘蛛抓過的 URL 數,三個數字對不上。有人第一反應是資料出错或者站点出問题,但多數时候,只是三個来源在數不同的東西。

三個數字各自在數什么

搜尋指令:估算值

site: 查询给出的是一個粗略量級。它受查询词、時間、地区影响,同一站点不同時間查、加不加關鍵詞,數字都會變。搜尋引擎會對近似重复的结果做折叠,也會過滤掉一些不展示的 URL,所以你得到的往往是一個被處理過的近似值,不是资产清單。

後台报告:處理後狀態

搜尋後台的索引报告按狀態分類,例如已编入索引、已發現但未抓取、已抓取未编入索引、重复網頁等。它統計的是已经被處理過的 URL,並且會把重复版本归到它選定的規范頁上。报告存在延迟,處理完成到狀態更新之間通常隔一段時間。

服務器日誌:抓取動作

日誌记錄的是蜘蛛實际請求了哪些 URL、請求了几次、返回什么狀態碼。它只反映抓取,不反映收錄。一個 URL 被反复抓取,仍然可能因為质量或重复問题無法進入索引;反過来,一個頁面長期被收錄却很少被抓,日誌里也可能看不到它。

對不上的常见原因

  • 時間窗口不同。日誌是實时寫入的,後台报告通常滞後一天到几天,查指令得到的又是当下這一刻的估算。
  • 范围不同。日誌包含被 robots 屏蔽的、带參數的、非規范的 URL,這些通常不會出現在索引报告里。
  • 規范化合並。多個近似 URL 在报告里會被合並成一個規范頁,日誌却會把每個版本分別记一筆,數量自然差得多。
  • 采样與估算。查指令的數字本身就不是精确統計,用来做趋势參考可以,用来做逐條核對不行。

几種典型差异怎么讀

指令數量遠大于报告數量

常见于參數多、篩選頁多、分頁深的站点。指令可能把一些被折叠或被過滤的 URL 也算進去,报告則只統計處理過並归類的。這種差距通常不代表收錄變好或變坏。

报告數量大于日誌抓取量

索引报告里包含大量很久以前抓取、狀態保留至今的頁面。如果近期日誌中几乎没出現這些 URL,說明的是它們不再被频繁抓取,而不是狀態一定變了。

日誌抓取很多,报告却不见增長

這才是需要認真看的情况。抓取不等于收錄,重点检查這几處:頁面返回的狀態碼是否稳定、是否誤加了 noindex、正文是否被模板挤到很靠後、與站内其他頁面是否高度相似、是否需要登入或依赖大量脚本渲染。

建议的核對顺序

  1. 先確認比較的是同一批 URL,最好導出清單再比對,不要用總數比總數。
  2. 再看時間窗口,把日誌按天切片,和报告的狀態更新日期對齐。
  3. 然後区分“抓取過”和“被處理過”,把日誌里抓過但报告里没有的 URL 單獨列出来。
  4. 最後抽二十到五十個样本頁,逐個看狀態碼、指令、正文與重复情况,比看大數字更有用。

该以哪個為准

没有哪個數字是绝對准确的。日誌用来判断蜘蛛来不来、来抓什么,报告用来判断處理结果和狀態分類,查指令只适合粗略感受量級。三者配合看,才能拼出完整画面。

三個數字不一致本身不是問题,問题是在不知道口径的情况下拿它們互相證明。先問“這個數字在數什么”,再决定要不要排查。