把新页面写进 Sitemap、从已有页面挂一个链接、或者用提交入口推一次,都只是把地址递到了搜索蜘蛛面前。地址被看到,和它被真正抓取,中间还隔着两段队列。等待期里站点能做的事不多,但做错的事却不少。
发现与抓取,是两段不同的队列
搜索蜘蛛先在大范围里收集地址,这一步通常叫 URL 发现;收集到的地址进入待抓取队列,再按一定节奏安排实际访问。两段队列的节奏并不一致:发现可能很快,抓取则受站点历史抓取表现、服务器响应状况、地址本身的重复度等因素影响,时间上很难给出统一预期。
这意味着「提交了却没动静」并不一定是出错。比较务实的做法是先把入口铺到位,然后观察日志,而不是连续重复提交同一个地址。
等待期里,先确认入口本身没问题
- Sitemap:地址要能被正常访问,格式正确,且不要把重定向、参数噪声、已经 404 的地址混进去。
- 内链:从已有页面挂一条真实可点的链接,比只在 Sitemap 里列出来更容易被顺着走。链接放在正文或导航区,通常好于藏在深层列表中。
- 入口页可访问:页面返回 200,不要未登录跳转、不要渲染完成前是空白、不要被 robots 规则挡住。
- 站外入口:一个自然的外部引用能增加被发现的机会,但不必为此批量做外链,收益有限且风险更高。
服务器状态决定抓取会不会被打断
状态码要稳定
首次抓取时如果遇到 5xx、连接超时或长时间无响应,蜘蛛通常会在稍后重试,但重试节奏会放缓。频繁的 5xx 是最容易让地址在队列里被往后排的原因之一;相比之下,偶尔一次失败影响有限。
带宽和并发别卡在临界点
新页面集中上线时,如果同一时间请求量猛增,页面响应时间上升,抓取体验会变差。分批发布、错开高峰,通常比一次性放几百个地址更容易被抓完。
等待期不建议做的几件事
- 反复改 URL:刚提交就换路径,等于把已经发现的结果作废,重新走一遍发现流程。
- 频繁调整页面主体内容:抓取还没发生,内容已经变了几轮,消耗的是后续重新抓取的机会。
- 连续重复提交:同一个地址短时间内推很多次,一般不会加快抓取节奏。
- 临时加验证或跳转:登录墙、验证码、强制跳转都会打断抓取路径。
判断进度最可靠的方式,是看服务器日志里是否出现对应的抓取记录,而不是看提交次数。
用日志判断进展,再决定下一步
在日志中筛选目标 URL,观察是否已有抓取请求、返回码是多少、请求来自哪个 UA。如果长期没有请求,可以回头检查入口是否铺对、页面是否可访问、站点整体抓取是否异常。若日志里已经出现抓取且返回 200,剩下的就是等待后续处理,不必再做额外动作。
小结
新 URL 从被发现到被首次抓取,存在一段无法精确控制的等待期。这段时间里能做的,是把入口铺好、让服务器保持稳定响应、避免在地址和内容上反复折腾,然后用日志确认进展。它不保证结果,但能减少地址长期卡在队列里的可能。