网站收录

索引里显示“已发现-当前未抓取”:从 URL 队列到抓取预算的排查顺序

在索引报告里,“已发现-当前未抓取”常被误当成技术故障。它更多反映 URL 已知但还没排上抓取队列。本文先区分它和“已抓取-未编入索引”的差别,再从发现渠道、抓取预算、服务器响应三个方向给出排查顺序,并说明哪些调整值得做、哪些只是等待。

网站收录

索引里显示“已发现-当前未抓取”:从 URL 队列到抓取预算的排查顺序

打开索引报告,有时会看到一批 URL 停在“已发现-当前未抓取”。这个状态容易让人紧张,但它本身并不等于页面有问题。它说的是:搜索引擎已经通过某种渠道知道了这个 URL,但还没有把它放进抓取队列,或者排了但还没轮到。把它和“已抓取-当前未编入索引”混在一起看,排查方向容易跑偏。

两个状态说的不是同一件事

已发现-当前未抓取:URL 进入了待抓取清单,抓取动作还没发生。页面内容、质量、规范指向都没有被真正评估过。

已抓取-当前未编入索引:抓取已经完成,内容被读到了,但决定暂时不放进索引。这时才轮到内容质量、重复度、规范指向这些问题。

所以看到“已发现-当前未抓取”,先不要急着改标题、改正文,重点应该放在“为什么没轮到抓”上。

常见的三种原因

1. URL 发现太容易,量又太大

站点地图、内链、分页、筛选参数、历史遗留地址,都会不断把新 URL 送进发现渠道。如果每天新增的 URL 数量远超抓取能力,队列就会越积越长。尤其是参数组合、日历归档、标签页这类页面,很容易把抓取名额占满。

2. 抓取预算被低价值页面消耗

抓取预算不是一个固定数字,它跟站点规模、更新频率、服务器响应速度都有关系。小站预算本来就有限,如果大量 URL 是薄内容或重复内容,真正需要抓的页面反而排不上。这时表现就是:重要页面卡在“已发现”,而一些无关紧要的页面却被反复抓取。

3. 服务器响应拖慢了抓取节奏

抓取速度会被服务器响应影响。如果页面打开慢、经常超时、返回 5xx,抓取频率会被主动降低,队列消化速度自然变慢。这类问题在日志里通常能看到规律:同一时间段大量请求超时,或者响应时间明显拉长。

排查顺序可以这样走

  1. 先看这批 URL 值不值得抓。是正文页、商品页,还是参数页、归档页、测试页?如果本身就不需要收录,用 noindex 或规范指向处理掉,比催抓更有效。
  2. 再看 URL 是怎么被发现的。站点地图里是否混进了大量低价值地址?内链是否把入口导向了不重要的页面?发现渠道越杂,队列越容易被稀释。
  3. 检查服务器日志。看抓取频率、响应码分布、平均响应时间。如果 5xx 或超时占比高,先解决稳定性。
  4. 对比已抓取页面的表现。如果抓取正常但索引不理想,问题可能不在队列,而在内容质量或重复度,这时要换一套排查思路。
  5. 确认没有误屏蔽。robots.txt、防火墙、CDN 规则如果拦住了抓取,状态也可能长时间不动。抓取屏蔽和“已发现”同时出现时,要先排除拦截。

哪些调整值得做

  • 精简站点地图,只保留需要收录的规范 URL。
  • 减少参数组合和重复列表页的可抓取入口。
  • 把内链集中到核心页面,避免入口分散。
  • 提升服务器响应速度,减少超时和 5xx。
  • 对已确认不需要收录的 URL,用 noindex 或 robots.txt 明确处理。
  • 给重要页面稳定的入口,不要只靠站点地图发现。
“已发现-当前未抓取”更多是排队问题,不是页面被否定。先判断 URL 是否值得抓,再决定是优化发现渠道还是等待队列消化。

最后提醒一点:这个状态的数量会波动,抓取队列本身也有优先级调整。短期内小幅变化不必反复改动站点。如果连续几周大量核心页面都停在这里,再按上面的顺序逐项核对,通常能找到更具体的原因。