在索引覆盖率报告里,URL 通常不会只分成“收录”和“没收录”两类。中间还夹着几个容易被忽略的状态:已发现但尚未抓取、已抓取但尚未编入索引、已编入索引但被选为备用网页。只看最终数字,很容易误判问题出在哪一环。
三个中间状态各自说明什么
- 已发现,尚未抓取:搜索引擎知道这个地址存在,但还没安排抓取。常见于链接刚出现、站点抓取节奏有限、地址只来自外部且入口单薄。
- 已抓取,尚未编入索引:内容已经被读取,但系统判断当前不值得放进索引,或需要更多信号来确认。
- 已编入索引,但被选为备用网页:存在多条相似地址,规范版本另有其人。
状态本身是信号,不是结论。同一个状态下,原因可能完全不同,需要往上游去找。
先确认这批 URL 是否真的需要收录
很多“收录不动”的问题,本质是这些地址并不需要收录。下面几类可以先排除:
- 筛选、排序、会话追踪参数生成的地址。
- 站内搜索结果页、空白列表页、无内容的分页。
- 同一内容的多份副本:打印版、PDF 预览、AMP、独立移动版地址。
- 由模板批量生成、正文几乎相同的聚合页。
把希望被收录的地址和不希望被收录的地址分开看,报告里的数字才有意义。
从链接入口往下核对
如果地址确实该收录,先看它被谁链接、链接有多深。
- 主导航、面包屑、栏目列表里有没有稳定的入口。
- 从首页到目标页需要几次点击,是否超过三四层。
- 入站内链是否只有一条,且来自同样低质量的页面。
- 锚文本是否描述了页面主题,还是清一色的“点击这里”。
- 站点地图里的地址与实际可访问地址是否一致。
入口单薄时,“已发现”会长期停在原地。
再核对抓取与渲染是否完整
抓取能返回 200,不代表内容被完整读取。需要确认:
- 返回码正常,且没有被 robots 规则挡住关键资源。
- 正文在首屏 HTML 里,还是依赖脚本渲染;若是后者,渲染后的内容是否与预期一致。
- 页面是否被 CDN、登录墙、验证页拦截,抓到的只是一张空壳。
- canonical 指向的地址是否与此页一致,有没有自相矛盾。
页面质量信号看哪些
抓取完成后,是否进入索引更多取决于页面本身。可以按下面几点自查:
- 主体内容占比:正文与导航、广告、推荐模块的比例。
- 独特性:与站内其他页面、站外同题内容的重复程度。
- 信息完整度:是否有明确主题、可读的段落结构、必要的说明。
- 时效与维护:更新时间、是否长期无人维护。
- 站点整体印象:同一目录下的页面是否普遍偏薄、是否大量重复。
一个可执行的核对顺序
- 把目标 URL 按状态分组,不要混在一起看。
- 剔除本就不该收录的参数页、重复页、空列表页。
- 检查入口层级与内链数量,补齐导航或相关推荐。
- 模拟访问,确认返回码与渲染结果。
- 核对 canonical、robots、站点地图三者是否一致。
- 对比同站已收录的相似页面,找出差异点。
- 调整后观察若干抓取周期,再看状态是否变化。
收录没有固定公式,状态流转也需要时间。把“已发现”和“已抓取”当成独立问题处理,通常比盯着总收录数更有用。这些调整只是提高条件被满足的概率,没有人能保证某个地址一定被收录。