在搜索后台的索引报告里,常能看到一种状态:URL 已被发现,但尚未抓取。它和“已抓取但未编入索引”是两回事。前者说明搜索引擎知道这个地址存在,只是还没去读它;后者说明已经读过,但判断不值得进索引。把这两种情况混在一起处理,往往白忙一场。
这个状态意味着什么
搜索引擎发现 URL 的途径主要有三种:站内链接、Sitemap、外部链接。发现之后,地址会进入待抓取队列。队列不是先到先服务,而是按预估价值和抓取成本排序。所以出现“已发现但未抓取”,通常说明两件事之一:这个地址在队列里排得很靠后,或者站点整体可用的抓取额度被别的地址占满了。
先分清三种情况
一、正常的排队
新站、新目录、刚上线的内容,被发现后等几天到几周才被抓取很常见。如果这类 URL 数量不多,而且都是你真正想要的页面,一般不需要额外操作,把内链和 Sitemap 补好即可。
二、额度被低价值 URL 占用
当站点存在大量参数页、筛选页、站内搜索结果页、重复列表页时,搜索引擎会把抓取额度花在这些地址上,真正重要的页面反而排在后面。典型表现是:日志里抓取量不小,但抓的多是不重要的地址,新页面迟迟轮不到。
三、抓取被技术问题挡住
服务器响应慢、频繁返回 5xx、请求超时、限速过严,都会让搜索引擎降低抓取频率。这种情况下即使 URL 已经被发现,也可能长时间停在“未抓取”。先修服务器,比改内容更有效。
常见的额度浪费来源
- 站内搜索、排序、筛选参数生成的大量 URL
- 标签页、归档页、日历页的无限翻页
- 已删除但内链还指向的地址,走一次跳转再落到 404
- 重定向链,例如 A 跳 B、B 又跳 C,每次跳转都消耗一次请求
- 同一个列表页的多个近似版本,内容差别很小
按顺序排查
- 看服务器日志:抓取集中在哪些目录,平均响应时间多少,5xx 占比多少。
- 看重要页面的内链:能否从首页两三跳内到达,锚文本是否有意义。
- 收紧 Sitemap:只提交你希望被索引的规范 URL,不要全量塞进去。
- 核对 robots.txt:确认没有误屏蔽 CSS、JS 或整段目录。
- 控制生成端:站内搜索、筛选、排序类页面加 noindex,或者干脆不生成可抓取的链接。
- 处理重定向链:把多跳合并成一跳,直接指向最终地址。
抓取和收录不是一回事
被抓取只代表页面被读过了。是否进索引,还要看内容质量、重复程度和页面本身的用途。抓取额度理顺之后,“已发现但未抓取”的数量会下降,但“已抓取但未索引”未必跟着解决,后者要回到内容和重复问题上去查。
把待抓取队列当成待办清单,先问哪些地址根本不值得被抓,再问怎么让值得的地址排到前面。
什么时候可以等,什么时候要动手
如果只有少量新 URL 停在待抓取,日志显示抓取节奏正常,等一两周是合理的。如果待抓取列表持续增长、日志里却几乎看不到这些目录,或者抓到的页面中重要页面的比例一直很低,就值得按上面的顺序查一遍。
最后提醒一句:不要为了让某个地址“被抓”,临时堆大量内链或反复提交。这类操作对抓取排序的影响有限,反而可能把更多不重要的地址送进队列,进一步挤压真正页面的空间。