在搜索控制台里看到“已发现-尚未抓取”,或者服务器日志里长时间没有对应蜘蛛的访问记录,很多人会直接把它当成收录问题。更准确地说,这通常卡在URL 发现和抓取调度之间,离索引还有一段距离。先分清当前状态,再决定要不要动页面,能少走很多弯路。
先分清三种状态,不要把问题混在一起
- 已发现,未抓取:搜索引擎知道这个 URL 存在,但还没有安排蜘蛛来取内容。
- 抓取失败:蜘蛛来过,但服务器返回了错误、超时或被拦截,内容没有取到。
- 已抓取,未索引:内容已经取回,但系统判断暂时不值得进入索引。
这三者的排查方向完全不同。如果日志里根本没有蜘蛛记录,优先看“发现”和“抓取优先级”,而不是去改标题和正文。
入口信号是否有效
URL 被发现的途径主要有内链、sitemap、外部链接和手动提交。入口信号弱,页面就可能一直停在“已发现”状态。
- 内链是否来自可抓取、有稳定抓取频率的页面,而不是孤立的深层页。
- sitemap 中的 URL 是否可访问、是否返回 200、是否和页面实际地址一致。
- 外部链接是否来自被频繁抓取的站点,还是几乎没有抓取价值的页面。
入口存在不等于入口有效。一个只被低质量页面链接一次的 URL,被发现后等待很久才被抓取,并不罕见。
robots 层面的限制要单独看
如果 robots.txt 禁止抓取某个目录或参数,蜘蛛可能知道 URL 存在,但不会去取内容。此时搜索控制台常显示“已发现-尚未抓取”或类似的受限状态。
注意:noindex 需要蜘蛛先抓到页面才能生效;robots 禁止抓取则可能让页面连内容都取不到。两者不要混用。
核对时重点看:robots.txt 是否有误伤、是否阻止了 CSS/JS 等渲染资源、是否有针对特定参数的屏蔽规则。
抓取预算与站点整体优先级
搜索引擎不会平均分配抓取资源。站点越大、低质 URL 越多,单个页面的等待时间就越长。
- 站点是否存在大量参数组合、筛选页、重复列表,稀释了抓取配额。
- 是否有大量返回 404、软 404 或重定向链的 URL,消耗蜘蛛时间。
- 重要页面是否被放在较浅的点击距离,还是埋在多层面包屑之后。
抓取预算不是固定值,它会随站点质量、更新频率和服务器响应速度变化。先减少无效 URL 的暴露,比反复提交单个页面更有效。
URL 质量与重复度也会影响调度
同一个内容对应多个地址,比如带参数、大小写、斜杠、默认文件名不同,容易让调度系统降低对这类 URL 的抓取意愿。canonical 可以表达偏好,但不能替代入口收敛。
- 统一站内链接指向规范版本,不要多种写法混用。
- 对无实际内容的筛选、排序、追踪参数,尽量用 robots 或链接规则控制。
- 确认页面不是空壳、模板占比过高或信息增量极低。
建议的核对顺序
- 确认日志里有没有蜘蛛访问,排除“抓取失败”和“已抓取未索引”。
- 检查内链和 sitemap 是否给出了有效入口。
- 核对 robots.txt,确认没有误伤目标 URL 或渲染资源。
- 查看站点是否因大量低质、重复 URL 拉低了整体抓取效率。
- 收敛重复地址,统一内链和 canonical 指向。
- 观察一段时间,不要在同一天反复改 URL 或频繁提交。
“已发现”只说明 URL 进入了候选池,离抓取和收录还有距离。先把入口、可抓取性和 URL 质量理顺,再耐心观察调度变化,通常比反复折腾页面内容更接近问题本身。