新页面上线,最常听到的一句话是「怎么还没被收录」。但在收录之前,还有一个更早的环节:蜘蛛得先知道这个 URL 存在。发现和抓取是两步,中间还隔着一次排队。
URL 发现与首次抓取,是两件不同的事
发现指的是蜘蛛在某个地方看到了一条指向新地址的链接;抓取指的是它真正发出请求、把页面内容拿回来。前者只是把你的 URL 放进候选队列,后者才轮到抓取调度决定什么时候来、以多高的频率来。
所以会出现这样的情况:URL 已经在日志里出现过一次,之后再没动静;也有页面几个月没被抓,某天突然被访问。这中间差的往往不是「提交了没有」,而是这条 URL 在站内外的位置、站点整体的抓取节奏,以及服务器当时的响应状态。
蜘蛛发现新 URL 的常见入口
站内链接:最直接,也最可控
从已有页面指向新页面的普通链接,是发现效率最高的入口之一。前提是这些链接出现在蜘蛛本来就会访问的页面上,比如首页、栏目页、上一级页面。如果新页面只被一个同样没人抓的页面链接,那么它被发现的时间就会被拖长。
Sitemap:批量告知,但不等于立刻来
Sitemap 的作用是把一批 URL 集中摆出来,适合新页面成批上线、或者站内链接不容易覆盖到的地址。它是「告知」,不是「召唤」。提交之后,蜘蛛仍会按自己的节奏处理,尤其是站点整体抓取频率不高的时候。
外部链接:把蜘蛛从别处带过来
来自其他站点的链接,会让蜘蛛在抓取对方页面时顺便看到你的新地址。这里要注意的是,外链的价值在于「被真实抓取并解析」,而不是数量堆叠。短时间内凭空出现大量指向同一地址的链接,容易让这条 URL 显得异常。
发现之后,为什么还要等
- 抓取队列的优先级:蜘蛛对首页、栏目页这类高频更新页面的回访更勤,对深层页面会放到更后面。
- 站点的整体抓取节奏:一个长期稳定更新、响应正常的站点,通常比一个时快时慢、经常返回 5xx 的站点更容易被稳定回访。
- 页面自身的位置:点击距离越远、入口越少的 URL,越容易被排在后面。
- URL 本身的形态:带长参数、会话 ID 的地址,可能被当作重复或低价值入口处理。
新页面发布时,可以顺手做的事
- 在上级栏目页或相关页面上加一条正常的正文链接,而不是只在导航或页脚堆链接。
- Sitemap 里补上这条 URL,更新对应的时间字段,让它和真实更新时间一致。
- 确认页面能直接返回 200,不要用跳转把新地址绕到旧地址。
- 避免同一批上线几百个内容相似的页面,那容易稀释蜘蛛对其中每一页的注意力。
- 发布后留意服务器日志里这条 URL 的第一次请求,看它拿到的状态码和响应时间。
怎么判断蜘蛛真的来了
最直接的办法还是看服务器日志:按 URL 过滤,看访问时间、返回状态、请求头和 User-Agent。如果日志里长期只有你自己的访问记录,说明这条 URL 还没进入抓取队列,可以先回过头检查入口链接和 Sitemap 是否生效。如果日志里已经有请求,但状态码是 5xx 或频繁超时,问题就不在发现环节,而在服务器稳定性上。
发现 URL 是入口问题,抓取 URL 是调度问题,抓取成功与否是服务器问题。三层分开看,排查起来会清楚很多。
把这三层分清楚,新页面上线后就不用只盯着「收录没收录」一个结果,而是能判断它卡在哪一步。