很多站点运营者会盯着日志问:这个页面昨天改了,蜘蛛怎么还没来?其实蜘蛛的再访间隔不是后台设了一个定时器,而是抓取调度根据多种信号算出来的结果。理解这些信号,比反复提交 URL 更有用。
再访间隔由什么决定
蜘蛛第一次抓到一个 URL 后,会把它放进待抓队列。下次什么时候回来,通常看几件事:
- 页面在站内的位置:首页、栏目页、被多个内链指向的详情页,再访频率通常高于深层页面。
- 历史更新频率:如果页面长期稳定,蜘蛛会降低回访频率;如果经常有新内容,它可能更勤快。
- 抓取预算和站点健康度:服务器响应慢、错误多,蜘蛛会把时间花在重试上,再访自然被推迟。
- 页面变化幅度:只改了一个标点,和新增了一段正文,蜘蛛看到的“变化信号”不同。
- Sitemap 与提交入口:更新 lastmod、提交新 URL 能提供参考,但不是立刻召来的开关。
不同页面的再访节奏不一样
首页和新闻列表可能几小时到一天就被回访;普通文章页可能几天到几周;长期不更新的“关于我们”可能更久。这不是偏见,而是调度在按页面价值分配抓取资源。想让重要页面更快被回访,比较稳妥的做法是把它放在内链较浅的位置,并让栏目页保持更新。
常见误区
- 一改内容就改 lastmod:如果内容没实质变化,只改时间戳,短期可能引来一次抓取,长期会降低这个信号的参考价值。
- 反复手动提交:提交是通知,不是排队加速器。频率过高没有额外收益,还可能被忽略。
- 以为蜘蛛会按固定周期回来:没有固定周期。站点整体抓取表现变化,再访间隔也会跟着变。
- 把再访慢等同于被惩罚:更多时候只是抓取预算有限,或者页面在调度里优先级不高。
怎么观察再访是否正常
从日志里按 URL 聚合,看同一路径两次蜘蛛访问的间隔。如果之前是两三天,现在变成两三周,同时其他页面也变慢,先查服务器响应、错误率、robots 和 WAF 是否误拦。如果只有个别页面变慢,再检查它是否被移出内链、是否返回了软 404、是否内容长期没更新。
可以主动做的事
- 保持服务器稳定,减少超时和 5xx,让蜘蛛每次来都能顺利抓完。
- 更新重要内容时,让 URL 保持可访问,并确认内链路径没有断。
- Sitemap 里的 lastmod 如实反映实质更新,不要批量刷成当前时间。
- 把新页面挂在已有抓取频繁的栏目或列表页下,缩短发现路径。
- 定期看日志,区分“没被发现”和“被发现但再访慢”,两者处理方式不同。
再访间隔是抓取调度的结果,不是一个可以单独催促的数值。把站点可用性、内链结构和更新信号做好,蜘蛛回来的节奏通常会更合理。