入口頁上线之後,後台能看到的往往只是一個“蜘蛛来訪次數”。但真正能用来做判断的信息,大多躺在服務器的訪問日誌里。日誌是原始记錄,没有经過任何工具的二次加工,讀得细一点,能省下不少瞎調的時間。
先想清楚要回答什么
面對几百萬行日誌,漫無目的地翻是没用的。通常先鎖定三個問题:哪些入口頁真正被爬過、蜘蛛在池子里走到了多深、有没有異常的請求模式。带着問题去筛字段,效率會高很多。
几個值得重点看的字段
- 客戶端 IP 與 User-Agent:两個一起看,單看 UA 很容易被伪造的字符串骗過去。
- 請求 URL 與狀態碼:判断蜘蛛是拿到了内容,還是撞上了 404、403、301。
- 响應時間:入口頁如果長期超過两三秒才返回,抓取频率往往會自己降下来。
- Referer:能看出蜘蛛是從哪個頁面的連結跳過来的,反推池内鏈路是否通畅。
清洗比分析更花時間
原始日誌里有大量静態资源請求、监控探针和自家測試訪問,直接統計會嚴重失真。建议先做三件事:過滤掉图片、CSS、JS 這類非頁面請求;把同一 IP 在短時間内的连續請求归並成一次會话;按入口頁 URL 做聚合,而不是按整站看總量。
四個常用的观察角度
- 覆盖率:池子里有多少入口頁在統計周期内至少被訪問過一次。長期零訪問的頁面,要么没被任何連結指向,要么被 robots 或 meta 挡住了。
- 有效抓取比:頁面請求占總請求的比例。如果大部分請求都花在资源文件上,說明入口頁的体积或结构正在消耗抓取額度。
- 抓取深度:從入口頁出發,蜘蛛能否走到第二层、第三层。只抓首屏就走的比例偏高,通常指向連結不明顯或頁面内容單薄。
- 时段與频次:同一 IP 一天来几次、集中在哪個时段。频次突然翻倍或骤降至零,都是需要回查的信号。
從異常信号到具体動作
日誌的價值在于把“感觉不對”變成“知道改哪”。几種常见情况:
- 某個入口頁持續返回 404:連結该換就換,別让蜘蛛反复扑空。
- 單 IP 高频、路径机械、不加载任何资源:更可能是采集脚本,不必当成真實蜘蛛来優化。
- 狀態碼大面积 301:检查 canonical 或跳轉鏈路是不是寫得太绕。
- 訪問量集中在少數几個入口頁:說明内鏈分布不均,其他頁面缺少被發現的机會。
日誌看的是趋势,不是單次。一天的資料說明不了什么,连續两三周同一指标朝同一個方向走,才值得動手調整。
留存與采样
日誌建议至少保留 30 天,方便做同比。全量存储成本高的话可以按天采样,但要保證同一时段的采样比例一致,否則前後對比會失去意义。另外记得關掉日誌里不必要的敏感參數,避免把用戶信息寫進去。
说到底,日誌分析不是什么高深的技術,它只是把“蜘蛛来了没有”這個模糊問题,拆成若干可量化、可复查的小問题。每次只改一處,再看下一轮日誌有没有變化,這種笨办法反而最稳。