網站收錄

日誌里的蜘蛛不一定是真的:收錄核對前先驗一遍身份

抓取日誌里蜘蛛訪問一大片、索引却没什么動静时,先別急着怪抓取配額或内容质量。伪装 UA 的采集器、第三方工具和监控拨测都會留下漂亮的蜘蛛痕迹,把它們算進統計里,後面的判断基本都會走偏。本文给出從 UA 到反向解析再到官方資料交叉的核對顺序,以及過滤後该怎么重新統計。

網站收錄

日誌里的蜘蛛不一定是真的:收錄核對前先驗一遍身份

抓取日誌里出現一大串蜘蛛訪問记錄,索引却没什么變化,很多人的第一反應是去看抓取配額、内容质量或者站点權重。但在這些之前,還有一步常被跳過:日誌里這些“蜘蛛”到底是不是真的。伪装 UA 的采集器、第三方工具的模拟抓取、可用性监控,都會在日誌里留下漂亮的蜘蛛痕迹,把它們算進抓取統計里,後面的判断基本都會走偏。

真假蜘蛛的差別不在“抓没抓”,而在“抓了算不算”

真蜘蛛的抓取會進入發現、抓取、處理這條鏈路——抓下来之後是否建索引是另一回事,但至少這次訪問是真的讀取了頁面。假蜘蛛只是把 HTML 拉走,對你的索引没有任何意义。

所以,如果把假蜘蛛的訪問当成“頁面已经被發現”,就可能得出“明明被抓了,為什么還不收錄”的错誤结论;把假蜘蛛的频次当成抓取配額,又會誤以為配額被老地址占满。

核對一次身份:從 UA 到 IP,再回到 IP

  1. 先看 UA,但只当作线索。完整 UA 一般包含版本、平台等信息,並且會随官方更新變化。截断的、多年不變的、明顯拼凑的 UA,先标记出来。
  2. 做反向解析,再正向驗證。拿来源 IP 做反向 DNS,看主机名是否落在官方域名(例如 googlebot.com、google.com);如果落在,再對该主机名做正向解析,確認解析回来的 IP 與日誌里的来源 IP 一致。两步都對上,才作為候選。
  3. 與官方的抓取資料交叉。站長平台里的抓取統計通常只統計经過驗證的蜘蛛,用它的時間分布和 URL 清單跟日誌對一遍,能很快看出哪些记錄属于噪声。

各家的驗證方式和公布的網段並不一致,以官方帮助文档给出的方法為准,不要套用別家的規則。

容易被算成蜘蛛的几類流量

  • 站点可用性监控與拨测服務:来源多為 IDC 机房,訪問間隔极其規律。
  • 第三方 SEO 或建站工具的模拟抓取:UA 里常带工具名,却容易被讀成蜘蛛。
  • 内容采集器:UA 伪装,行為特征是连着抓正文、很少抓静態资源。
  • 自己的预渲染、缓存预热或内部脚本:很容易在日誌里刷出高訪問量。
先把這几類剔掉,再去統計抓取频次與狀態碼分布,數字才有意义。

核對完之後,統計口径怎么改

建议把驗證通過的主机名和網段沉淀成一份白名單,日誌按白名單過滤後再做三件事:

  • 統計真蜘蛛的抓取频次與狀態碼分布,重点看 5xx、超时和 429。
  • 比對“真蜘蛛抓過的 URL”與“頁面上线時間”,判断發現鏈路是否顺畅。
  • 把從未被真蜘蛛訪問過的地址單獨列出,再回头查内鏈、入口與提交记錄。

別把抓取和收錄混成一件事

身份核對只是把噪声去掉。真蜘蛛抓過不等于會被收錄,收錄與否還要看内容是否重复、頁面是否規范、是否能從別的地址取到同样的内容。反過来,假蜘蛛抓得再多,也不會推動收錄一步。因此核對顺序建议是:先筛日誌、確認身份,再看抓取,最後才谈索引和收錄。顺序對了,才不會在错誤的數字上做優化。