新页面发布之后,最常被问到的一句话是:多久能被收录?这个问题没有统一答案,因为收录速度取决于搜索引擎什么时候发现这个 URL、愿意为它安排一次抓取、以及抓取之后判断它是否值得进索引。这三步里任何一步卡住,时间都会被拉长。与其盯着一个具体天数,不如先判断自己遇到的是正常等待,还是有什么东西挡住了。
收录是三个环节串起来的
把过程拆开看会清楚很多:发现(URL 被蜘蛛知道)、抓取(蜘蛛真的来取了一次)、索引(内容被判定为可收录并入库)。很多站点只看最后一步的结果,忽略了前面两步的状态,于是把还没被发现当成内容质量不行来处理,方向从一开始就错了。
影响收录速度的常见因素
- 有没有内链指向。新页面如果只存在于 sitemap,没有任何站内入口,被发现的时间通常比有正常内链的页面晚很多。
- 站点整体的抓取活跃度。抓取频率高的站点,新页面被扫到的概率更大;长期不更新、蜘蛛来得少的站点,等待时间会更长。
- URL 是否稳定。页面刚上线就换目录、改参数、加带跟踪参数的版本,会让蜘蛛反复从头认识这个地址。
- 技术层面的拦截。robots.txt 屏蔽、meta noindex、canonical 指到别处、返回 4xx 或 5xx,都会让页面停在抓取之后、索引之前。
- 内容本身是否太薄或高度重复。正文只有一两句话,或者大部分内容和其他页面一致的页面,即使被抓取,也不一定会进入索引。
- 服务器响应情况。响应慢、经常超时,蜘蛛可能取到一半就放弃,下一次再来又要等。
先分清该等和该修
判断依据不是时间长短,而是日志里有没有蜘蛛的痕迹:
- 日志里没有这个 URL 的抓取记录,大概率还没被发现,优先补内链、检查 sitemap 是否包含,而不是改文案。
- 日志里已经抓取,但索引里没有,检查 noindex、canonical、状态码,以及内容是否过薄,问题出在抓取之后的环节。
- 日志里有抓取、状态码正常、内容也不薄,只是还没进索引,这类情况多数只需要继续观察,频繁改动反而会让蜘蛛不断重新评估。
一个可执行的排查顺序
- 确认 URL 只有一个规范版本,且返回 200。
- 确认 robots.txt 和页面 meta 没有被误拦。
- 确认页面上至少有一条来自相关页面的站内链接。
- 在 sitemap 中确认该 URL 存在,且 lastmod 是真实修改时间。
- 查服务器日志,看蜘蛛是否来过、来的频率、返回状态。
- 已经抓取但未收录时,回到内容层面看是否存在重复或信息量不足的问题。
几个常见的催收录误区
把这些动作当成必收录的开关,通常会失望:反复提交 URL、短时间内大批量提交、给页面堆外链、为了让它被抓而复制出一堆近似页面。这些做法最多影响被发现的速度,改变不了抓取之后的判断。
- 频繁改动刚上线的页面,会让蜘蛛每次看到的都是新版本,反而延长稳定判断的时间。
- 把收录慢全部归因于内容质量,忽略了内链和日志这两条更直接的线索。
- 只看索引量这一个数字,不看具体是哪些 URL 被收录、哪些没被收录。
合理的预期
对大部分有正常更新和站内链接的站点来说,新页面在一段时间内被发现并抓取是常态,但具体多快,受抓取频率和页面优先级影响,波动很大。与其设定一个固定天数,不如建立一套观察机制:记录发布日、首次抓取日、首次收录日,积累一段时间后,你会对自家站点的正常节奏有判断,也更容易看出某一个页面是真的异常,还是只是还没轮到。
收录速度是结果,不是可以直接控制的动作。能控制的是把发现路径打通、把技术拦截排除、把内容做扎实,剩下的交给时间。