发现、抓取、索引:三个环节的耗时本来就不一样
新页面发布之后,不少人每隔几小时查一次收录,看到状态一直没变化,就开始改标题、改内链、改 URL。但收录不是一个动作,而是三个前后相接的环节:URL 被发现、页面被抓取、内容进入索引。三个环节的耗时差别很大,混在一起看,很容易把正常等待当成故障处理。
把这三步分开观察,判断会清楚很多。发现看入口,抓取看日志,索引看页面本身的质量和重复度。
发现:入口决定有没有被看到
网站地图、站内链接、外部链接、历史抓取记录,都是蜘蛛发现 URL 的来源。新页面上线后如果没有任何入口指向它,状态通常停留在未抓取阶段,这一步主要受站点抓取频次和链接层级影响,和页面内容好坏关系不大。
抓取:日志里能看到的事实
抓取是唯一可以在服务器日志里直接确认的环节。如果日志中已经有对应 URL 的访问记录,并且返回 200,说明抓取已经完成,此时再去催促抓取意义有限。
索引:最慢也最不可控的一步
抓取记录天天都有,索引里却一直不出现,说明卡在第三步。这一步和内容是否与其他页面高度重复、页面主体是否清晰、站点整体质量有关,继续提高抓取频次通常帮不上忙。
等待期里先核对这几处
- 日志里有没有该 URL 的抓取记录,返回码是不是 200;
- robots.txt 或 meta noindex 有没有把它挡住;
- canonical 是否指向自己或正确的规范页面;
- 服务端返回的 HTML 里能不能直接看到正文;
- 站内是否至少有一条正文链接指向它,而不是只出现在网站地图里。
这几项都属于可以用工具或日志确认的硬问题。如果都正常,剩下的就是时间问题,改动反而不容易看出效果。
哪些信号说明可以继续等
页面已经出现在日志里、返回码正常、内容与其他页面有明显区别、canonical 正确,这种情况下更稳妥的做法是保持不动,把复查间隔拉长到一周左右再看。频繁改动标题和正文,会让蜘蛛每次抓到的内容都不一样,反而增加判断成本。
另外,站点规模也会影响时间尺度。内容量大、历史抓取频繁的站点,新页面进入索引的速度通常更快;内容少、抓取频次低的站点,等上几周也属于常见情况。
复查节奏怎么安排
- 发布当天确认 URL 可访问、返回 200,页面在网站地图或内链中可达;
- 发布后两三天看一次日志,确认是否被抓取,这一步不用看索引状态;
- 抓取完成后再看索引,间隔一周左右复查一次;
- 持续两到三周仍无变化,再回到内容重复度和站点结构上排查;
- 每次只改一项,改完留出观察时间,否则无法判断是哪一项起了作用。
真正需要立刻动手的情况
和上面相反,有些问题不该等:返回 4xx 或 5xx 的页面、被 robots 误屏蔽的目录、canonical 指错页面、正文完全依赖前端渲染且渲染资源被屏蔽、同一内容存在多个 URL 变体互相竞争。这些问题不修,等多久都不会有结果。
把“抓取没发生”和“抓取了但没进索引”分开看,能省掉大部分无用改动。抓取看日志,索引看内容,两者之间没有捷径。