网站收录

已发现但未抓取、已抓取但未编入索引:两种状态别用同一套办法

页面索引报告里的“已发现-尚未抓取”和“已抓取-尚未编入索引”经常被混着看,但前者是排队问题,后者是取舍问题。本文拆开讲两种状态的成因、排查顺序和常见误判,帮你判断这一轮该优化抓取链路,还是该动页面本身。

网站收录

已发现但未抓取、已抓取但未编入索引:两种状态别用同一套办法

在 Search Console 的页面索引报告里,“已发现 - 尚未抓取”和“已抓取 - 尚未编入索引”是两个经常被混着看的数字。它们的中文表述很像,但指向的原因几乎不重叠。用同一套办法去处理,多半会白忙一场。

先看清两种状态各说了什么

已发现 - 尚未抓取:搜索引擎知道这个 URL 存在,但还没去访问它。URL 可能来自内链、外链、站点地图或提交接口。这条记录说明的是排队问题,不是内容问题。

已抓取 - 尚未编入索引:爬虫已经访问过页面,拿到了内容,但决定不放进索引。这条说明的是取舍问题——它看过了,觉得没必要留。

一句话区分:前者是“还没轮到”,后者是“看过了没要”。

已发现但未抓取:往抓取这条线上找原因

  • 站点整体响应慢或经常超时,爬虫每次来都拿不到完整内容。
  • 站内存在大量自动生成的低价值 URL,把抓取额度先消耗掉了。
  • 新页面入口太深,只靠站点地图提交,站内没有像样的链接指向。
  • 站点地图里塞了几万个 URL,而站点实际被抓取的速度远低于这个量级。
  • 整个站点缺少外部链接,爬虫的访问频率本来就低。

这类情况改内容基本没用。优先做的是:把重要 URL 用站内链接接进主干、压缩无意义 URL 的数量、把服务器响应时间压下来。

已抓取但未编入索引:往内容和重复上找原因

  • 页面与站内其他页面高度雷同,只差几个字段或几句描述。
  • 正文有效信息太少,主体内容被导航、推荐、广告挤到后面。
  • 页面是模板批量拼出来的,不同 URL 之间的差异对用户没有意义。
  • 正文依赖 JS 渲染,而抓取时拿到的是空壳。
  • canonical、noindex、robots 之间存在互相打架的配置。
  • 内容与其他站点大量重复,或者本身就是转载。

排查顺序建议

  1. 先在报告里抽样几条 URL,逐条确认页面本身能否正常打开、返回码是否正常。
  2. 如果状态集中在“已发现”,先看站点日志里的抓取频率和总抓取量,再看内链结构。
  3. 如果状态集中在“已抓取”,把这几条 URL 的正文抽出来,和同类页面并排比一比。
  4. 改动之后不要天天盯数字,给一到两周让抓取和重新评估跑完。
  5. 记录改动时间和改动内容,否则后面无法判断是什么起的作用。

几个常见的误判

  • 把未抓取当成质量问题去改内容:内容改得再好,没被访问到就没意义。
  • 把未编入索引当成额度问题去堆内链:内链再多,重复页面还是重复页面。
  • 看单日数据下结论:这两种状态会互相转换,某天从 A 跳到 B,可能只是抓取节奏变化。
  • 把报告数字当全集:索引报告是抽样展示,数量级可参考,具体到某个 URL 要单独查。

一个可执行的小流程

先按状态分组,每组各取 5 到 10 条 URL 做样本。已发现的那组,重点看入口和抓取额度;已抓取的那组,重点看正文和重复度。两边都做完一遍,再决定这一轮是优化抓取还是优化内容。混在一起改,最后往往说不清是哪一步起了作用。

收录这件事很少靠单点动作解决。把两种状态分开看,至少能让你知道这一轮该动的是站内结构,还是页面本身。