新页面发布后迟迟不收录,很多人的第一反应是“内容不够好”,于是改标题、加字数、补外链。但“不收录”是个笼统的说法,它至少包含三个环节:URL 有没有被发现、发现了有没有被抓取、抓取之后有没有进入索引。这三步的判断方式和处理动作完全不同,混在一起猜,很容易在错误的环节上花力气。
三个环节分别指什么
未发现:搜索引擎还不知道这个 URL 存在
新页面如果没有任何入口指向它,搜索引擎就没有理由知道它。所谓入口,包括站内链接、站点地图、外链,以及页面本身可被抓取的静态链接。未发现的典型表现是:站点地图提交了但没动静,站内找不到通往该页面的链接,页面只能靠直接输入地址访问。
已发现未抓取:URL 进了队列,但还没轮到
搜索引擎知道了地址,不代表马上来取。抓取需要排队,站点整体抓取能力有限,优先级低的 URL 可能等很久。常见原因包括页面层级太深、站点响应慢、同类页面太多导致队列拥挤,以及页面本身没有明显的更新信号。
已抓取未索引:页面被取回,但没被采用
这一步才是内容层面的问题居多。页面被抓取了,但搜索引擎判断它不值得单独放进索引,可能因为内容过薄、与站内其他页面高度重复、主体内容需要交互才出现,或者被 robots、canonical、noindex 等指令拦下。
怎么判断卡在哪一步
顺序上建议从后往前确认,因为指令类问题最好先排除。
- 先看页面有没有被 robots.txt、noindex 或 canonical 指向别处拦住。
- 用收录状态查询确认 URL 是否已在索引中;如果已收录,问题就不在这三个环节里,而在排序或展示层面。
- 如果没收录,看是否有“已发现但未抓取”的记录,用来区分未发现和未抓取。
- 对照服务器日志,看搜索引擎是否来过、来的是哪个 URL、返回什么状态码。
索引状态查询工具给出的分类,本身就对应这几个环节,比只看“有没有收录”更有信息量。
对应环节的处理顺序
如果是未发现
- 先补内链。从相关页面自然链过去,比任何提交都直接。
- 确认站点地图包含该 URL,且没有被规则误排除。
- 检查链接是否为可抓取的 a 标签,而不是需要点击才触发的脚本行为。
如果是已发现未抓取
- 先看服务器响应时间和错误率,慢站点会拖累整体抓取。
- 检查是否有大量低价值 URL 占用抓取,比如参数组合、筛选结果、重复列表。
- 再考虑站点地图和内部链接,把重要页面往上提。
- 耐心等待。抓取排队本身需要时间,频繁改动反而会让信号不稳定。
如果是已抓取未索引
- 看内容是否完整:正文是否在初始 HTML 中,还是完全依赖脚本渲染。
- 检查是否与站内其他页面重复,尤其是同一内容的不同 URL 写法。
- 确认页面有明确主题,不是素材堆叠或自动生成的拼接内容。
- 检查是否有过多的关键词堆砌或明显的模板痕迹。
几个容易误判的情况
- 页面已经收录,只是查询方式没查到,误以为没收录。
- 抓取正常但索引被合并到另一个 URL,看起来像“没收录”。
- 页面内容更新了,索引仍是旧版本,这属于重新抓取问题,不是首次收录问题。
- 站点地图提交成功不等于被抓取,提交只是提供了地址。
把“不收录”拆成发现、抓取、索引三段,每一步都有自己的判断依据。先定位,再动手,比一上来就改内容省力得多。
实际排查时,尽量不要同时改内容、改链接、改指令。一次只动一个变量,隔一段时间再看状态变化,才能知道是哪一步起了作用。