在搜索资源平台里,URL 的状态通常分几种:已抓取、已发现尚未抓取、已编入索引、已排除。其中“已发现,尚未抓取”最容易让人焦虑——链接提交了,蜘蛛显然也知道它存在,但就是迟迟不来。这篇文章拆解这个状态的含义、常见卡点和排查顺序。
这个状态到底代表什么
它说明搜索引擎已经通过某种方式拿到了这条 URL:可能是 sitemap,可能是蜘蛛池入口页上的链接,可能是外链,也可能是你手动提交。但“知道”不等于“安排抓取”,抓取要消耗资源,搜索引擎会把它放进队列,按优先级和站点可承受的抓取速度慢慢取。
所以这个状态本身不是故障,真正需要判断的是:它是暂时排队,还是长期被压在队列底部。几天不动属于正常,几周甚至几个月不动,才值得排查。
常见卡点
1. 抓取预算被低价值页面消耗
如果站点每天的抓取额度大量花在筛选页、重复参数页、站内搜索结果页上,留给新 URL 的自然就少。此时不是蜘蛛没发现,而是它没空。
2. 服务器响应质量不过关
抓取前蜘蛛会评估成本。响应时间长期偏高、并发一上来就返回 5xx、或者频繁超时,都会让抓取调度更保守。这种保守是全局的,新 URL 也会被一起拖慢。
3. URL 本身的优先级判定偏低
没有内链、没有外链、内容与已有页面高度相似、参数变体一堆,都会降低抓取优先级。搜索引擎判断的是“抓了有没有价值”,而不是“你提交了几次”。
4. 发现渠道本身不稳定
如果 URL 只依赖蜘蛛池入口页被发现,而入口页时好时坏、链接是动态插入的、或者入口页本身已经被降权,那么“已发现”可能只完成了一半——蜘蛛知道链接存在,却拿不到足够的上下文去判断它的价值。
建议的排查顺序
从外部到内部、从全局到单页依次看:
- 先看日志:确认蜘蛛最近是否来过站点、抓了哪些目录。日志里完全没有对应 UA,问题偏向发现或调度;日志里来过却绕开目标 URL,问题偏向结构或优先级。
- 再看服务器:统计一段时间的响应码分布和平均响应时间。5xx 占比和超时次数,比单纯的抓取次数更值得关注。
- 看抓取分布:哪些目录吃掉了大部分抓取量。如果低价值目录占比过高,先收紧那部分,而不是继续加大入口页数量。
- 看单页条件:目标 URL 是否可正常访问、是否有内链支撑、是否与已有页面重复、参数是否失控。
- 最后看发现方式:入口页是否还能被正常抓取,链接是否为静态可见的 a 标签。
可以做的调整
- 清理重复和低质页面,减少无意义的抓取消耗;
- 把重要 URL 放在站内更浅的位置,用真实内容页互链,而不是只靠入口页;
- 优化响应速度,避免 5xx 与超时,给抓取留出余量;
- 保持 sitemap 干净,只放需要被收录的规范 URL;
- 入口页保持可访问、链接稳定、内容与目标站相关。
几个常见误区
反复提交同一条 URL,通常不会明显改变抓取优先级。提交解决的是“知不知道”,不解决“值不值得抓”。
- 把“已发现”当成“即将收录”,然后每天提交一次;
- 只堆入口页数量,不看抓取预算和站点承载能力;
- 忽略服务器日志,凭感觉判断蜘蛛有没有来。
小结
“已发现,尚未抓取”本质上是一个排队状态,短时间是正常的。如果长期不动,优先排查抓取预算、服务器响应和 URL 价值,而不是继续增加提交次数。这些环节理顺之后,抓取节奏通常会慢慢恢复,但具体节奏和结果由搜索引擎决定,无法承诺时间。