常见问题

目标 URL 一直停在“已发现未抓取”,该查入口页还是目标页?

搜索蜘蛛把 URL 记为“已发现”却没来抓,很多人第一反应是蜘蛛池入口页失效。其实入口页的链接信号不足、目标页不可抓或被降权,都会造成这个状态。本文分别列出两侧要检查的要点,并给出从日志到 sitemap 的排查顺序,帮你判断问题卡在哪一环。

常见问题

目标 URL 一直停在“已发现未抓取”,该查入口页还是目标页?

在蜘蛛池和站点运营里,“已发现未抓取”是日志和站长工具中最常见的状态之一。它说明搜索蜘蛛已经通过某个入口页看到了链接,但还没有真正去请求目标 URL。很多人第一反应是入口页失效,实际排查时,入口页和目标页都要看,只是检查顺序不同。

先分清“已发现”和“已抓取”是两个阶段

搜索蜘蛛处理一条链接,大致分两步:发现,也就是在入口页解析到链接;抓取,也就是真正发出请求。停留在前一步,说明链接被记录但没有进入抓取队列的执行环节。原因既可能是入口页给出的信号不够,也可能是目标页本身让调度系统不愿意优先安排。

入口页侧要检查的问题

  • 链接是否真的写在 HTML 里。用 JavaScript 渲染、iframe 或 meta refresh 生成的链接,发现速度通常更慢,甚至只被当作待确认项。
  • 链接是否被 nofollow、robots.txt 或页面级 noindex 削弱。入口页整体 noindex 时,顺链发现仍可能发生,但优先级会下降。
  • 入口页响应时间是否过长。首字节时间经常超过一两秒,蜘蛛抓完入口页后往往不会马上继续跟随链接。
  • 同一个入口页的链接数量是否波动太大。一次从几十个变成上千个,容易触发抓取节流。
  • 入口页是否长期返回高度重复的内容。模板重复度高时,蜘蛛对页面上链接的信任度会降低。

目标页侧要检查的问题

  • 目标 URL 是否被 robots.txt 屏蔽,或者返回 5xx、长时间不响应。
  • 目标页是否存在大量重复内容,或者 canonical 指向了别的地址。
  • 目标页是否有登录墙、验证码或反爬拦截,导致蜘蛛请求拿不到正常页面。
  • 目标 URL 在站内是否还有其他入口。如果只有蜘蛛池入口页这一条路径,被安排抓取的顺位会更靠后。
  • 目标页是否属于新域名或新目录,新站点本身的抓取配额就比较有限。

抓取预算和优先级的影响

搜索蜘蛛每天的抓取量有限,会按页面质量和历史表现来分配。入口页质量一般、目标页又缺少其他信号时,链接容易长期躺在队列里。真正能改善的方向,是让入口页稳定可抓、目标页正常可访问,并让目标 URL 同时出现在 sitemap、站内导航等多个位置,而不是只依赖蜘蛛池一条路径。

建议的排查顺序

  1. 用服务器日志确认蜘蛛是否真的请求过入口页,以及返回的状态码是什么。
  2. 查看入口页 HTML 源码,确认目标 URL 能直接看到,而不是靠脚本后期拼接。
  3. 检查目标 URL 是否被 robots.txt、登录墙或防火墙挡住。
  4. 对比 sitemap 提交情况和站内链接,看目标 URL 是否有别的发现路径。
  5. 观察一到两周,再看“已发现未抓取”的数量是否减少,避免频繁改动入口页结构。
“已发现未抓取”不是错误状态,而是排队状态。它更多反映优先级和抓取预算,短时间内没来抓并不等于链接一定有问题。

小结

遇到这个状态,先看入口页能不能被正常抓取、链接是不是源码可见,再看目标页能不能正常访问。两边都排查完,剩下的往往是抓取预算和时间问题。不要为了催抓而反复改动入口页,频繁变动反而会让蜘蛛重新评估整个入口的可信度,短期内更难看到效果。