在 Search Console 的页面索引报告里,“已发现 - 尚未抓取”和“已抓取 - 尚未编入索引”是两个经常被混着看的数字。它们的中文表述很像,但指向的原因几乎不重叠。用同一套办法去处理,多半会白忙一场。
先看清两种状态各说了什么
已发现 - 尚未抓取:搜索引擎知道这个 URL 存在,但还没去访问它。URL 可能来自内链、外链、站点地图或提交接口。这条记录说明的是排队问题,不是内容问题。
已抓取 - 尚未编入索引:爬虫已经访问过页面,拿到了内容,但决定不放进索引。这条说明的是取舍问题——它看过了,觉得没必要留。
一句话区分:前者是“还没轮到”,后者是“看过了没要”。
已发现但未抓取:往抓取这条线上找原因
- 站点整体响应慢或经常超时,爬虫每次来都拿不到完整内容。
- 站内存在大量自动生成的低价值 URL,把抓取额度先消耗掉了。
- 新页面入口太深,只靠站点地图提交,站内没有像样的链接指向。
- 站点地图里塞了几万个 URL,而站点实际被抓取的速度远低于这个量级。
- 整个站点缺少外部链接,爬虫的访问频率本来就低。
这类情况改内容基本没用。优先做的是:把重要 URL 用站内链接接进主干、压缩无意义 URL 的数量、把服务器响应时间压下来。
已抓取但未编入索引:往内容和重复上找原因
- 页面与站内其他页面高度雷同,只差几个字段或几句描述。
- 正文有效信息太少,主体内容被导航、推荐、广告挤到后面。
- 页面是模板批量拼出来的,不同 URL 之间的差异对用户没有意义。
- 正文依赖 JS 渲染,而抓取时拿到的是空壳。
- canonical、noindex、robots 之间存在互相打架的配置。
- 内容与其他站点大量重复,或者本身就是转载。
排查顺序建议
- 先在报告里抽样几条 URL,逐条确认页面本身能否正常打开、返回码是否正常。
- 如果状态集中在“已发现”,先看站点日志里的抓取频率和总抓取量,再看内链结构。
- 如果状态集中在“已抓取”,把这几条 URL 的正文抽出来,和同类页面并排比一比。
- 改动之后不要天天盯数字,给一到两周让抓取和重新评估跑完。
- 记录改动时间和改动内容,否则后面无法判断是什么起的作用。
几个常见的误判
- 把未抓取当成质量问题去改内容:内容改得再好,没被访问到就没意义。
- 把未编入索引当成额度问题去堆内链:内链再多,重复页面还是重复页面。
- 看单日数据下结论:这两种状态会互相转换,某天从 A 跳到 B,可能只是抓取节奏变化。
- 把报告数字当全集:索引报告是抽样展示,数量级可参考,具体到某个 URL 要单独查。
一个可执行的小流程
先按状态分组,每组各取 5 到 10 条 URL 做样本。已发现的那组,重点看入口和抓取额度;已抓取的那组,重点看正文和重复度。两边都做完一遍,再决定这一轮是优化抓取还是优化内容。混在一起改,最后往往说不清是哪一步起了作用。
收录这件事很少靠单点动作解决。把两种状态分开看,至少能让你知道这一轮该动的是站内结构,还是页面本身。