很多站长会问“新页面多久才会被收录”,这个问题其实没有统一答案,不同站点、不同页面类型的节奏差别很大。更实用的做法是把“收录”拆成几个能观测的节点:URL 被发现、蜘蛛来抓取、页面进了索引。三段各有自己的判断依据,混在一起看,很容易得出错误结论。
为什么“多久收录”很难直接回答
收录速度受站点规模、抓取频率、内容完整度和站内链接结构影响,同一个站的不同栏目也可能差异明显。所以与其盯死一个天数,不如检查每一段是否在正常推进。哪一段停了,问题就在哪一段。
把时间线拆成三段
第一段:URL 被发现
蜘蛛要先知道这个 URL 存在。发现路径主要有站内链接(列表页、相关推荐、面包屑)、XML Sitemap、外部链接以及提交工具。新页面如果只藏在渲染后的菜单里,或者要从首页点三四层才到,被发现的时间就会明显拉长。
核对方式:在服务器日志里搜这个 URL,看有没有第一次请求记录。如果几天都没有任何抓取,问题多半卡在这一段,而不是内容质量。
第二段:被真正抓取
发现不等于抓取。日志里出现 200 状态码的 GET 请求,才算真正抓了一次内容。以下几种情况都不能算成功抓取:
- 只有 HEAD 请求,没有取回正文
- 返回 301、302 跳转到别处
- 被 5xx 挡回,或被 CDN、WAF 拦成 403、429
- 返回 200 但字节数和页面实际大小差得很远
第三段:进入索引
抓取成功之后,页面还要经过质量判断才会进索引。这一段最不透明,只能靠 site: 查询、索引状态工具,以及页面能否用特定长尾词搜到来间接判断。要注意 site: 查询结果本身会波动,只能当参考,不能当精确数字。
建议的核对顺序
- 先查日志里有没有该 URL 的首次抓取记录,没有就先解决发现路径。
- 有抓取记录,再看返回码和响应体积,排除拦截、跳转和空响应。
- 抓取正常,隔一段时间用 site: 或索引状态工具复查,看是否进入索引。
- 长期不进索引,再拿同类已收录页面比对内容完整度、正文长度和站内上下文。
- 把多个新页面放在一起看趋势。单页异常和全站变慢,处理方式完全不同。
几个常见误判
- 把抓取当收录。日志里频繁出现某个 URL,不代表它已经进了索引。
- 用快照判断。快照更新慢和是否收录是两件事,不能互相证明。
- 反复提交同一批 URL。短期重复提交不会加快索引,反而可能分散抓取资源。
- 只看首页。首页收录快、内页慢是常见现象,不代表站点整体出了问题。
能主动做的几件事
- 让新页面从已收录页面获得至少一条站内链接,缩短点击深度。
- 把重要新页面放进 Sitemap,并保证 lastmod 和实际更新时间一致。
- 检查移动端渲染后正文是否完整,避免主体内容依赖二次请求。
- 控制参数页、空白筛选页的产生,减少对抓取资源的占用。
收录是一个过程,不是一个开关。把发现、抓取、入索引分开看,才知道该修哪一段。