为什么先看日志而不是先改页面
收录数据通常是延后的,报告里看到的“已发现未抓取”“已抓取未编入索引”都是结果。而搜索蜘蛛的访问日志是过程记录:它什么时候来过、抓了哪些 URL、拿到什么状态码、停留多久,这些信息往往在收录数字变化之前就已经出现。遇到收录慢、收录量下滑,先翻日志常常比直接改页面更省事,至少能判断问题出在抓取这一层,还是出在页面质量这一层。
日志里值得关注的字段
- 时间:看同一批 URL 是每天被抓,还是隔几周才来一次。频次的变化通常早于收录的变化。
- URL:把参数、分页、筛选、站内搜索结果页单独挑出来,这些路径最容易吃掉抓取量。
- 状态码:200 是正常抓取,301/302 看跳转是否绕路,404/410 看死链是否还挂在入口上,5xx 和 429 说明服务器端在挡请求。
- User-Agent:区分移动端和桌面端蜘蛛,也用于识别伪装成蜘蛛的普通请求,避免把正常流量当成抓取。
- 响应大小与耗时:返回体积异常小、耗时明显偏长的页面,可能是模板出错或接口超时,蜘蛛拿到的东西和用户看到的不一样。
几种常见的抓取模式及其含义
反复抓同一批 URL
如果日志里翻来覆去就是那几十个页面,新 URL 几乎不出现,问题多半在 URL 发现链路:新页面没有拿到站内入口,或者入口位置太深、需要多次点击才能到达。这时改标题、改正文帮助不大,先把入口补上。
列表页抓得勤,详情页很少
蜘蛛在列表页反复游走却不进详情,常见原因是列表里的链接靠脚本动态拼接、被遮挡,或者详情页本身响应慢。可以先确认详情页在不执行脚本的情况下,是否有可直接点击的正常链接。
抓取量大但状态码杂乱
日志里 404、5xx、重定向占比高,说明抓取量被消耗在无效路径上。先清理死链和错误跳转,再谈提升抓取效率。
抓取频次忽高忽低
整站突降通常和服务器稳定性、robots.txt 变更、整站改版有关,可以对照日志里的日期找分界点,而不是凭印象判断。
从日志到动作的顺序
- 取一段完整周期的日志,至少覆盖一到两周,避免只看某一天就下结论。
- 按状态码和 URL 类型分组,算出每一类占用的抓取比例。
- 把“抓得最多”和“最该被抓”的两组 URL 放在一起对比,看抓取资源是否错配。
- 针对错配的部分做小改动,比如补内链、清理参数入口、修正跳转链。
- 记下改动日期,之后再看日志里对应 URL 的抓取频次有没有变化。
日志只能证明蜘蛛来过,不能证明页面已经被索引,也不能保证改动后一定被收录。它是排查线索,不是收录承诺。
日志看不到的部分
抓取日志不包含蜘蛛内部的排队与取舍逻辑,也不反映页面质量的评估结果。所以它更适合回答“它有没有来、来抓什么、拿到的响应是否正常”,不适合单独用来判断“为什么这个页面没被索引”。把日志和索引状态报告、页面质量一起看,结论才比较可靠。