抓取日誌里每條請求都對應一個入口。把入口来源归類,比單纯統計抓取總量更能解释“為什么這個頁面一直没被回訪”。
入口来源的常见類別
- Sitemap 與索引提交:首次出現時間與提交時間接近,被發現的 URL 往往路径較深。
- 站内連結:從導航、列表、正文連結逐层扩散,抓取顺序呈現由外向内、由浅入深的特征。
- 站外連結:来源分散,回訪是否稳定取决于對方頁面本身是否被持續抓取。
- 重定向與歷史路径:舊 URL、RSS、接口提交、站内搜尋頁、分頁參數都可能成為入口。
日誌里的可行性判断
蜘蛛請求大多不带 referer,直接看来源字段往往得不到答案。更可行的做法是用時間與路径序列去推断。
- 先按 UA 與 IP 段過滤出蜘蛛請求,剔除监控、CDN 回源和自检流量。
- 标记每個 URL 的首次抓取時間,與 Sitemap 提交、内鏈上线、外鏈發布的時間点做前後比對。
- 看同一批請求的顺序:從列表頁连續進入詳情頁的抓取,多半說明入口来自内鏈。
- 观察回訪間隔。只靠 Sitemap 的頁面,回訪間隔通常更長,且波動更大。
归類结果的用途
归類不是做报表,而是决定下一步把精力花在哪里。
- 核心頁只在 Sitemap 出現、内鏈路径上從未被抓到,優先补内鏈,而不是反复提交。
- 深层頁只依赖站外入口,回訪波動大,考虑在相關栏目中增加稳定入口。
- 同一批 URL 被重复發現(带參數、大小寫、结尾斜杠差异),先做入口收敛,再谈抓取频次。
- 入口存在但頁面長期不回訪,重点检查响應耗时與狀態碼,而不是繼續加連結。
容易出現的誤判
- 把蜘蛛池或第三方抓取工具的請求当作搜尋引擎蜘蛛,導致入口判断整体偏移。
- 把 CDN 邊缘节点的訪問记錄重复計入,夸大入口數量。
- 把並發抓取誤認為多次發現,實际只是同一入口的批量請求。
- 忽略服務器错誤與超时,把抓取失敗全部归因于入口問题。
入口来源只能說明“可能從哪里被發現”,不能直接推導收錄结果。判断仍要回到頁面内容、站点结构與整体抓取表現。
落地動作
可以按固定周期做一次核對:導出最近一段時間的蜘蛛日誌,按入口類別打标,與内鏈改動、Sitemap 更新记錄對齐,观察两到四周内首次抓取時間與回訪間隔的變化。服務器稳定性、响應耗时和返回狀態碼仍是前提條件,這些指标異常时,入口归類的结论會失真。
把入口来源当作排查工具,而不是優化捷径。清單化执行、定期复盘,比追求單次提交後的即时反馈更可靠。