在索引覆盖率报表里,有时会看到一批 URL 的状态是“已发现,尚未抓取”。它和“已抓取,尚未编入索引”不是一回事:前者是搜索引擎已经知道这个地址存在,但还没安排抓取任务;后者是已经抓过页面,只是在决定要不要放进索引。理解这个区别,能避免把抓取排队问题当成内容质量问题来处理。
这个状态在说什么
“已发现”通常来自站内链接、站点地图、外部链接或之前抓取时顺带发现的地址。搜索引擎把这些 URL 放进待抓取队列,但队列有优先级和配额。当待抓取的地址远多于它愿意在近期抓取的数量时,一部分 URL 就会一直停在“已发现”状态。
所以这个状态本身不是惩罚,更像是一种排队信号:搜索引擎认为这些页面暂时不值得优先消耗抓取资源。站点能做的,是让重要的页面看起来更值得优先抓取,同时减少不重要的页面占用队列。
积压常见的几类原因
- URL 数量超出抓取能力。站点新增页面速度快,或者参数、筛选、排序组合生成了大量地址,抓取队列被低价值入口填满。
- 新页面没有站内入口。URL 只写在 sitemap 里,站内没有任何链接指向它。没有内链支撑的地址,通常会被排在后面。
- 页面重复或内容单薄。同一套内容用不同参数、不同排序生成了多个地址,搜索引擎需要花时间判断哪一个才值得抓。
- 服务器回应不稳定。超时、5xx 或频繁限流会让抓取速度下降,队列消化得更慢。
处理顺序:先分类,再动手
不建议把所有“已发现”的 URL 都当成必须马上抓取的对象。先按页面价值分一下:
- 核心页:产品、服务、主要栏目、重要文章。这类页面需要有稳定的内链入口,并出现在 sitemap 中。
- 长尾页:有独立内容、能被搜索需求命中的页面。可以保留,但不必强求全部快速抓取。
- 试验页:临时活动、测试参数、重复筛选。这类页面如果不需要收录,最好用 robots.txt 或 noindex 明确排除,减少它们进入待抓取队列。
分类之后,优先处理核心页的抓取入口,再考虑长尾页的补充。试验页的重点不是“让它被抓”,而是“让它不占用抓取资源”。
可以立刻做的几件事
- 补内链入口。把核心页链接放进栏目导航、相关推荐、列表页或文章正文中,尽量让链接出现在离首页较近的位置。
- 收敛站点地图。sitemap 只保留希望被索引的 URL;把参数页、重复页、已失效页从 sitemap 中移除,避免继续扩大队列。
- 清理重复入口。检查筛选、排序、追踪参数是否生成了大量可抓取地址。能用 canonical 合并的合并,该屏蔽的屏蔽。
- 检查服务器表现。看抓取日志里是否出现大量超时或 5xx。如果服务器响应慢,先解决稳定性,再谈抓取频率。
不建议做的事
反复提交 sitemap、短时间内大量堆外链、或者把所有 URL 都塞进“优先抓取”的幻想里,通常不会让队列加快多少。搜索引擎会自己判断抓取优先级,站点能做的是减少干扰项,而不是制造更多信号。
抓取积压更像一个排队问题:重要的页面要排到前面,不重要的页面不要占位置。把这两件事做好,比反复催促更有效。
观察节奏
调整之后,不要每天盯着状态变化。可以按周看抓取日志:核心页的抓取次数是否增加、服务器错误是否减少、新页面从“已发现”转为“已抓取”的时间是否缩短。如果两三周后核心页仍在积压,再回头检查内链深度、sitemap 范围和服务器响应。收录和抓取都需要时间,观察趋势比盯单个 URL 更有意义。