為什么先看日誌而不是先改頁面
收錄資料通常是延後的,报告里看到的“已發現未抓取”“已抓取未编入索引”都是结果。而搜尋蜘蛛的訪問日誌是過程记錄:它什么时候来過、抓了哪些 URL、拿到什么狀態碼、停留多久,這些信息往往在收錄數字變化之前就已经出現。遇到收錄慢、收錄量下滑,先翻日誌常常比直接改頁面更省事,至少能判断問题出在抓取這一层,還是出在頁面质量這一层。
日誌里值得關注的字段
- 時間:看同一批 URL 是每天被抓,還是隔几周才来一次。频次的變化通常早于收錄的變化。
- URL:把參數、分頁、篩選、站内搜尋结果頁單獨挑出来,這些路径最容易吃掉抓取量。
- 狀態碼:200 是正常抓取,301/302 看跳轉是否绕路,404/410 看死鏈是否還挂在入口上,5xx 和 429 說明服務器端在挡請求。
- User-Agent:区分移動端和桌面端蜘蛛,也用于识別伪装成蜘蛛的普通請求,避免把正常流量当成抓取。
- 响應大小與耗时:返回体积異常小、耗时明顯偏長的頁面,可能是模板出错或接口超时,蜘蛛拿到的東西和用戶看到的不一样。
几種常见的抓取模式及其含义
反复抓同一批 URL
如果日誌里翻来覆去就是那几十個頁面,新 URL 几乎不出現,問题多半在 URL 發現鏈路:新頁面没有拿到站内入口,或者入口位置太深、需要多次点击才能到達。這时改标题、改正文帮助不大,先把入口补上。
列表頁抓得勤,詳情頁很少
蜘蛛在列表頁反复游走却不進詳情,常见原因是列表里的連結靠脚本動態拼接、被遮挡,或者詳情頁本身响應慢。可以先確認詳情頁在不执行脚本的情况下,是否有可直接点击的正常連結。
抓取量大但狀態碼杂乱
日誌里 404、5xx、重定向占比高,說明抓取量被消耗在無效路径上。先清理死鏈和错誤跳轉,再谈提升抓取效率。
抓取频次忽高忽低
整站突降通常和服務器稳定性、robots.txt 變更、整站改版有關,可以對照日誌里的日期找分界点,而不是凭印象判断。
從日誌到動作的顺序
- 取一段完整周期的日誌,至少覆盖一到两周,避免只看某一天就下结论。
- 按狀態碼和 URL 類型分组,算出每一類占用的抓取比例。
- 把“抓得最多”和“最该被抓”的两组 URL 放在一起對比,看抓取资源是否错配。
- 针對错配的部分做小改動,比如补内鏈、清理參數入口、修正跳轉鏈。
- 记下改動日期,之後再看日誌里對應 URL 的抓取频次有没有變化。
日誌只能證明蜘蛛来過,不能證明頁面已经被索引,也不能保證改動後一定被收錄。它是排查线索,不是收錄承诺。
日誌看不到的部分
抓取日誌不包含蜘蛛内部的排队與取舍逻辑,也不反映頁面质量的评估结果。所以它更适合回答“它有没有来、来抓什么、拿到的响應是否正常”,不适合單獨用来判断“為什么這個頁面没被索引”。把日誌和索引狀態报告、頁面质量一起看,结论才比較可靠。