抓取日誌只說明“来過”,不說明“收錄了”
很多站点排查收錄問题时,第一步就是打開服務器日誌,看到搜尋引擎的 UA 频繁出現,就預設“蜘蛛来過了,收錄應该没問题”。但日誌记錄的是請求,索引记錄的是结果,两者之間還隔着内容质量判断、重复归並、渲染执行等环节。抓取量上涨而收錄量不動,這種情况並不罕见。
所以讀日誌的正确姿势,不是數總量,而是先给抓取分類,再看每一類的變化意味着什么。
把抓取拆成三類,再看占比
有效抓取:指向還没被抓過的 URL,或内容确實更新過的 URL
這類抓取才和收錄增長直接相關。判断方法不复杂:把日誌里的 URL 和已知 URL 库對比,属于首次出現的,或者上次抓取後頁面主体确實變動過的,才算有效。
重复抓取:同一個 URL 被反复請求,頁面却没什么變化
常见来源包括參數 URL、排序與篩選组合、分頁翻頁、站内搜尋结果頁。這類抓取會占用抓取額度,却不带来新的索引條目。如果重复抓取占比很高,優先检查 URL 生成端和連結出口。
渲染抓取:頁面加载後由脚本触發的资源與接口請求
日誌里经常能看到同一個 IP 在短時間内請求大量 js、css、接口路径,這通常属于渲染過程。它說明頁面被抓了,但不等于頁面内容被完整提取。如果渲染依赖的接口被 robots 屏蔽,或者首屏内容要等用戶交互才出現,渲染抓取再多,提取到的正文也可能不完整。
按目錄和模板拆,而不是看整站總量
整站抓取量是個很粗的指标,涨跌可能只由一两個栏目决定。更實用的做法是按目錄、模板、頁面類型分组統計:
- 哪些目錄被抓得多,但索引里几乎没有對應條目;
- 哪些模板的返回碼集中在 3xx、404 或 5xx;
- 哪些類型頁面的重复抓取次數明顯高于其他類型;
- 新發布的頁面平均多久被首次抓取,之後多久被重抓一次。
分组之後,問题通常會從“收錄不好”收敛到“某個目錄的某類頁面有問题”,處理起来才有方向。
把日誌和索引结果對上,才有判断依據
- 先取一段時間窗口的日誌,比如最近 7 天或 30 天,避免用單日資料下结论。
- 把日誌 URL 和索引中的 URL 做交集與差集,分出“抓了也收錄了”“抓了没收錄”“没抓也没收錄”三類。
- 對“抓了没收錄”的部分,再按頁面類型和内容特征抽样看,而不是逐個頁面看。
- 记錄改動前後的對比:同一批 URL 在調整内鏈、合並重复頁、补充正文之後,被抓取和進入索引的比例有没有變化。
抓取是收錄的前提,但不是收錄的保證。把日誌当成绩單,容易得出错誤结论;把日誌当线索,才知道下一步该改哪里。
什么时候该盯抓取,什么时候该盯内容
如果新頁面長期處于“已發現但未抓取”,或者重要頁面几周都没有被抓取记錄,問题多半在抓取端:入口太深、内鏈太少、目錄被大量低质 URL 稀释、服務器响應過慢。這时候優化 URL 结构、清理無效地址、改善响應速度,比改正文更有效。
反過来,如果頁面被抓取多次却始终不進索引,重点就不在抓取了。需要检查的是正文是否足够、模板占比是否過高、是否與其他頁面高度重复、是否有明确的規范 URL 指向。抓取日誌在這類問题里只能告诉你“来過几次”,答案要到頁面本身去找。
把這两個方向分開,收錄排查就不會在同一堆日誌里反复打轉。