在站长后台的索引覆盖报告里,“已发现——尚未编入索引”是一个很容易被忽略的状态。它既不是抓取失败,也不是被惩罚,而是介于两者之间的一个中间态:蜘蛛知道了这个 URL 存在,但还没有把它当成一个值得单独占据索引位的页面来处理。理解这个状态,比反复提交 URL 更有用。
先把四个状态分开看
很多人把抓取和收录当成一件事,其实中间至少隔着几步:
- 已发现:蜘蛛从内链、站点地图或外链看到了这个 URL,但还没访问。
- 已抓取:蜘蛛已经取回页面内容,也可能只取回了一部分。
- 已编入索引:页面内容被处理并进入了可供检索的索引。
- 可展示:在满足查询条件时,这条索引记录能被调出来。收录了但不展示,是很常见的情况。
“已发现但未编入索引”卡在第一步和第三步之间。它说明 URL 本身通常没问题,问题多半出在这个页面值不值得收,以及站点有没有给出足够的理由。
通常卡在三个地方
一是抓取预算被大量低价值 URL 摊薄
蜘蛛在一个站点上愿意花的时间和次数是有限的。如果站内存在大量参数页、筛选结果页、重复的标签页,蜘蛛的排队列表会被这些 URL 塞满,新页面排在后面,久等不至。此时要做的不是催,而是先把明显不值得抓的 URL 挡在外面,或者用规则收口,把空间让出来。
二是页面缺少单独占位的理由
如果两个页面主题几乎一样,只是措辞或排序略有差别,搜索引擎通常只会选其中一个进索引,另一个长期停在已发现状态。这不是错误,而是一种取舍。要判断的是:这些页面到底是有独立价值的不同内容,还是同一份内容的不同切法。如果是后者,合并或设置规范版本,比继续等收录更实际。
三是内链和站点结构给不出足够信号
一个页面被链接的次数、链接出现的位置、链接所在的页面本身是否重要,都会影响它被处理的优先级。深藏在四五层目录下、只有列表页一条链接的页面,和被导航、正文、相关推荐反复提到的页面,处境完全不同。
可以按这个顺序排查
- 确认 URL 能被正常访问,返回 200,没有被 robots.txt 挡住,页面里没有 noindex。
- 看这个 URL 在站内有多少条内链、来自哪些页面,链接是否可点击、是否可被抓取。
- 和站内其他页面比一比,判断它是不是高度重复或者内容偏薄。
- 查服务器日志,确认蜘蛛到底有没有真的来过;后台显示已发现,不等于已经抓取。
- 如果确认不值得单独收录,就主动合并或设置规范;如果值得,就补内链、补内容。
处理方向大致分两类
- 该收的:补足内容深度,从相关页面和导航里给出自然的入口,让它出现在蜘蛛经常走动的路径上。
- 不该收的:合并到主页面、设置规范地址、必要时禁止抓取,减少索引里的冗余记录。
两种方向都不涉及“提交后等结果”。提交只解决被发现的问题,而这里卡住的恰恰不是发现。
两个常见误区
反复提交 URL 不会提高收录概率,它只是重复告诉蜘蛛这个地址存在,而蜘蛛早就知道了。
另一个误区是把“已发现但未编入索引”当成惩罚信号。它更像一个排队状态,背后通常是结构、内容或预算的问题,而不是站点出了状况。
小结
看到这个状态时,先别急着催收录。把页面分成值得单独存在、其实和别的页面是一回事两类,前者补链接和内容,后者做合并和收口。索引覆盖报告里的数字变化,往往是这些动作的结果,而不是原因。