日誌能回答的問题
站点後台的抓取統計通常有延迟,粒度也粗,只能看到某個目錄大概被訪問了多少次。服務器日誌是原始记錄,能看清每一次請求的時間、来源、URL、狀態碼和响應耗时。對做站运营的人来说,它主要用来回答三件事:蜘蛛来没来、抓了哪些地址、抓的时候顺不顺利。
先確認訪問者是不是真蜘蛛
日誌里的 User-Agent 可以伪造,只凭 UA 判断容易出错。
- 核對 IP 归属:主流搜尋引擎會公布蜘蛛 IP 段,用官方渠道反查,別只看 UA 字符串。
- 看行為轨迹:真蜘蛛一般按連結顺序走,命中的多為頁面和静態资源;伪造者常集中請求後台、接口或某個特定路径。
- 看频率分布:真蜘蛛有相對稳定的抓取节奏,不會只盯着一個目錄猛刷。
把掃描器誤当成蜘蛛,會把抓取量算高,後面所有判断都會跟着跑偏。
抓取量只是入口,重点看分布
總請求數本身意义有限,更值得看的是抓取资源分给了谁。
- 首頁、频道頁是否被反复抓取,是否占用了大量請求。
- 詳情頁的抓取是否集中在最新發布的一批,老頁面長期没有訪問记錄。
- 是否大量抓取參數頁、篩選頁、站内搜尋结果頁,這類頁面數量巨大但價值通常不高。
- CSS、JS 等静態资源的抓取比例是否異常,蜘蛛需要它們来理解頁面,但占比過高會挤压頁面抓取。
狀態碼和响應時間要放在一起看
同一批 URL 反复返回 5xx,或者長時間超时,蜘蛛會主動降低抓取频率。這不是惩罚,是它在規避風險。如果日誌里某段時間 200 狀態明顯减少、超时增多,先查服務器、CDN 和解析,再谈收錄的問题。
哪些地址從来没被抓過
日誌里完全没有记錄的 URL,才是真正意义上的没被發現。
- 從站点地图抽一批 URL,和日誌逐條比對,找出零訪問的地址。
- 检查這些頁面是否只通過需要交互才能到達的入口暴露,比如点击展開、滚動加载、下拉篩選。
- 检查是否有内鏈指向它們,缺少内鏈的孤岛頁面往往只能靠站点地图,被發現的速度慢很多。
- 检查 robots.txt 是否挡住了其中一部分,被屏蔽的地址不會被抓取,但仍有可能出現在搜尋结果里,這两件事要分開看。
抓取不等于收錄
日誌只能證明蜘蛛来過,不能證明頁面進了索引,也不能證明它能在搜尋里被找到。
抓取之後還要经過内容理解、去重、质量判断等环节。日誌里抓取量很大但收錄没有變化,說明瓶颈可能不在發現和抓取,而在頁面本身:模板重复、正文太薄、和站内其他頁面高度相似,都會让頁面停在這一步之前。
建议的观察方式
不要只看某一天的日誌。按周對比同一目錄的抓取量,按頁面類型分组統計,才容易看出趋势。遇到波動时,先排除服務器和解析层面的問题,再往内容质量和連結结构上找原因。日誌是排查工具,不是结论本身。