网站收录

已发现、已抓取、未编入索引:索引状态分层下的核对顺序

索引覆盖率报告里,URL 不只有“已收录”和“未收录”。已发现但未抓取、已抓取但未编入索引这些中间状态,往往指向完全不同的原因。本文按状态分层,从链接入口、抓取渲染到页面质量,给出可执行的核对顺序。

网站收录

已发现、已抓取、未编入索引:索引状态分层下的核对顺序

在索引覆盖率报告里,URL 通常不会只分成“收录”和“没收录”两类。中间还夹着几个容易被忽略的状态:已发现但尚未抓取、已抓取但尚未编入索引、已编入索引但被选为备用网页。只看最终数字,很容易误判问题出在哪一环。

三个中间状态各自说明什么

  • 已发现,尚未抓取:搜索引擎知道这个地址存在,但还没安排抓取。常见于链接刚出现、站点抓取节奏有限、地址只来自外部且入口单薄。
  • 已抓取,尚未编入索引:内容已经被读取,但系统判断当前不值得放进索引,或需要更多信号来确认。
  • 已编入索引,但被选为备用网页:存在多条相似地址,规范版本另有其人。

状态本身是信号,不是结论。同一个状态下,原因可能完全不同,需要往上游去找。

先确认这批 URL 是否真的需要收录

很多“收录不动”的问题,本质是这些地址并不需要收录。下面几类可以先排除:

  • 筛选、排序、会话追踪参数生成的地址。
  • 站内搜索结果页、空白列表页、无内容的分页。
  • 同一内容的多份副本:打印版、PDF 预览、AMP、独立移动版地址。
  • 由模板批量生成、正文几乎相同的聚合页。
把希望被收录的地址和不希望被收录的地址分开看,报告里的数字才有意义。

从链接入口往下核对

如果地址确实该收录,先看它被谁链接、链接有多深。

  1. 主导航、面包屑、栏目列表里有没有稳定的入口。
  2. 从首页到目标页需要几次点击,是否超过三四层。
  3. 入站内链是否只有一条,且来自同样低质量的页面。
  4. 锚文本是否描述了页面主题,还是清一色的“点击这里”。
  5. 站点地图里的地址与实际可访问地址是否一致。

入口单薄时,“已发现”会长期停在原地。

再核对抓取与渲染是否完整

抓取能返回 200,不代表内容被完整读取。需要确认:

  • 返回码正常,且没有被 robots 规则挡住关键资源。
  • 正文在首屏 HTML 里,还是依赖脚本渲染;若是后者,渲染后的内容是否与预期一致。
  • 页面是否被 CDN、登录墙、验证页拦截,抓到的只是一张空壳。
  • canonical 指向的地址是否与此页一致,有没有自相矛盾。

页面质量信号看哪些

抓取完成后,是否进入索引更多取决于页面本身。可以按下面几点自查:

  • 主体内容占比:正文与导航、广告、推荐模块的比例。
  • 独特性:与站内其他页面、站外同题内容的重复程度。
  • 信息完整度:是否有明确主题、可读的段落结构、必要的说明。
  • 时效与维护:更新时间、是否长期无人维护。
  • 站点整体印象:同一目录下的页面是否普遍偏薄、是否大量重复。

一个可执行的核对顺序

  1. 把目标 URL 按状态分组,不要混在一起看。
  2. 剔除本就不该收录的参数页、重复页、空列表页。
  3. 检查入口层级与内链数量,补齐导航或相关推荐。
  4. 模拟访问,确认返回码与渲染结果。
  5. 核对 canonical、robots、站点地图三者是否一致。
  6. 对比同站已收录的相似页面,找出差异点。
  7. 调整后观察若干抓取周期,再看状态是否变化。

收录没有固定公式,状态流转也需要时间。把“已发现”和“已抓取”当成独立问题处理,通常比盯着总收录数更有用。这些调整只是提高条件被满足的概率,没有人能保证某个地址一定被收录。