在蜘蛛池和站点运营里,“已发现未抓取”是日志和站长工具中最常见的状态之一。它说明搜索蜘蛛已经通过某个入口页看到了链接,但还没有真正去请求目标 URL。很多人第一反应是入口页失效,实际排查时,入口页和目标页都要看,只是检查顺序不同。
先分清“已发现”和“已抓取”是两个阶段
搜索蜘蛛处理一条链接,大致分两步:发现,也就是在入口页解析到链接;抓取,也就是真正发出请求。停留在前一步,说明链接被记录但没有进入抓取队列的执行环节。原因既可能是入口页给出的信号不够,也可能是目标页本身让调度系统不愿意优先安排。
入口页侧要检查的问题
- 链接是否真的写在 HTML 里。用 JavaScript 渲染、iframe 或 meta refresh 生成的链接,发现速度通常更慢,甚至只被当作待确认项。
- 链接是否被 nofollow、robots.txt 或页面级 noindex 削弱。入口页整体 noindex 时,顺链发现仍可能发生,但优先级会下降。
- 入口页响应时间是否过长。首字节时间经常超过一两秒,蜘蛛抓完入口页后往往不会马上继续跟随链接。
- 同一个入口页的链接数量是否波动太大。一次从几十个变成上千个,容易触发抓取节流。
- 入口页是否长期返回高度重复的内容。模板重复度高时,蜘蛛对页面上链接的信任度会降低。
目标页侧要检查的问题
- 目标 URL 是否被 robots.txt 屏蔽,或者返回 5xx、长时间不响应。
- 目标页是否存在大量重复内容,或者 canonical 指向了别的地址。
- 目标页是否有登录墙、验证码或反爬拦截,导致蜘蛛请求拿不到正常页面。
- 目标 URL 在站内是否还有其他入口。如果只有蜘蛛池入口页这一条路径,被安排抓取的顺位会更靠后。
- 目标页是否属于新域名或新目录,新站点本身的抓取配额就比较有限。
抓取预算和优先级的影响
搜索蜘蛛每天的抓取量有限,会按页面质量和历史表现来分配。入口页质量一般、目标页又缺少其他信号时,链接容易长期躺在队列里。真正能改善的方向,是让入口页稳定可抓、目标页正常可访问,并让目标 URL 同时出现在 sitemap、站内导航等多个位置,而不是只依赖蜘蛛池一条路径。
建议的排查顺序
- 用服务器日志确认蜘蛛是否真的请求过入口页,以及返回的状态码是什么。
- 查看入口页 HTML 源码,确认目标 URL 能直接看到,而不是靠脚本后期拼接。
- 检查目标 URL 是否被 robots.txt、登录墙或防火墙挡住。
- 对比 sitemap 提交情况和站内链接,看目标 URL 是否有别的发现路径。
- 观察一到两周,再看“已发现未抓取”的数量是否减少,避免频繁改动入口页结构。
“已发现未抓取”不是错误状态,而是排队状态。它更多反映优先级和抓取预算,短时间内没来抓并不等于链接一定有问题。
小结
遇到这个状态,先看入口页能不能被正常抓取、链接是不是源码可见,再看目标页能不能正常访问。两边都排查完,剩下的往往是抓取预算和时间问题。不要为了催抓而反复改动入口页,频繁变动反而会让蜘蛛重新评估整个入口的可信度,短期内更难看到效果。