发布一篇新页面之后,很多人第一反应是去搜标题,搜不到就认定出了问题。但从发布到能在搜索结果里看到,中间要经过好几道关,每一关卡住的原因都不一样。把这几关分开看,排查才有方向。
第一关:URL 被发现
蜘蛛得先知道这个地址存在,才有可能来抓。常见的发现路径就这么几条:
- 站内链接:列表页、相关内容模块、面包屑指向新页面,这是最稳定的发现方式;
- 站点地图:适合批量提交,尤其是新栏目或一次上线几十个页面时;
- 外部链接:其他站点的链接会带来额外发现机会,但不可控;
- 主动提交入口:能缩短发现时间,但不改变后续的判断逻辑。
这一关的典型症状是:日志里完全看不到蜘蛛访问该 URL。此时该检查的是链接是否可达、是否被 robots 挡住、提交是否真的生效,而不是反复修改正文措辞。蜘蛛池之类的工具作用也止步于此,它们能提高 URL 被发现的概率,但决定不了后面几关的结果。
第二关:排队等待抓取
被发现不等于马上被抓。站点的抓取资源有限,新 URL 会先进入队列,排队时间长短和站点整体抓取健康度、页面所在目录的深度、以及该目录此前的抓取回报都有关系。
这个阶段日志里可能只有零星几次访问,也可能完全没有动作。能做的事不多:把新页面挂到已经被频繁抓取的页面附近,减少目录层级,让入口更靠近首页,比单独催某一个 URL 更有效。
第三关:抓取与渲染
蜘蛛来了,但抓到的内容和用户看到的不一定一样。如果主要内容依赖 JS 渲染,而渲染环节没走通,蜘蛛拿到的就是一个空壳。此时日志显示访问正常,页面却迟迟不进索引。
验证方法很直接:把页面 HTML 源码(不是浏览器里右键检查的 DOM)复制出来,看看正文、标题、主要链接是否在里面。如果不在,先解决渲染问题,再谈收录。
第四关:进入索引
抓取完成后,搜索引擎还要判断这个页面值不值得放进索引:内容是否和站内其他页面高度相似、是否只是模板拼出来的薄内容、是否对用户有独立价值。这一关卡住,日志上看不出异常,抓取频率也正常,就是索引状态不动。
这时能改的是页面本身:补充独有信息、合并高度重复的页面、给相似页面做明确的取舍。单纯重复提交或加快抓取,通常改变不了结论。
怎么判断自己卡在哪一关
- 查日志:有没有蜘蛛访问该 URL,访问了几次,返回什么状态码;
- 查抓取状态:是「已发现尚未抓取」,还是「已抓取尚未编入索引」;
- 查源码:正文和主要链接是否在原始 HTML 里;
- 查重复度:站内是否有另一条 URL 承载了几乎相同的内容。
常见卡点与对应动作
- 日志零访问 → 先查入口链接和 robots,别动正文;
- 有访问但一直排队 → 优化内链位置,减少路径层级;
- 抓取了但索引不动 → 看内容质量和重复度,而不是抓取频率;
- 索引里有但搜不到 → 这是展示层的问题,和收录不是同一件事。
四关之间是顺序关系,前一步没通过,后一步做什么都白费。排查时按顺序走,比同时改一堆东西更容易看出哪个动作起了作用。
最后需要一点耐心。新页面的收录本来就有延迟,几天到几周都算正常范围。与其每天反复提交,不如把入口链接、源码可见性、内容独立性这三件事做扎实,剩下的交给时间。