网站收录

收录状态卡在“已发现”:先分清是没抓还是没选

在索引报告里看到“已发现 – 当前未收录”,很多人第一反应是页面被惩罚了。其实这个状态只说明搜索引擎已经知道这个 URL 存在,但还没有抓取,或者抓取后没有把它选入索引。要处理它,先通过服务器日志区分没抓取和已抓取未收录,再从内链入口、层级深度、内容差异和 URL 规范逐项核对。

网站收录

收录状态卡在“已发现”:先分清是没抓还是没选

在索引报告里看到“已发现 – 当前未收录”,很多人第一反应是页面被惩罚了。其实这个状态只说明搜索引擎已经知道这个 URL 存在,通常来自内链、sitemap 或外部链接,但还没有抓取,或者抓取后没有把它选入索引。它更像一个排队提示,而不是最终结论。

要处理它,第一步不是提交索引,也不是改模板,而是先分清:到底没抓,还是抓了没选。这两条路的核对顺序不同。

先用日志区分两种子情况

索引报告的状态比较粗,服务器日志能提供更直接的线索。找到目标 URL,看最近一段时间有没有爬虫访问记录:

  • 日志里没有访问记录:URL 已发现,但还没进入抓取队列,问题多半在入口和抓取优先级。
  • 日志里有访问,返回 200:页面已被抓取,但索引状态没变化,重点转向内容质量和重复判断。
  • 日志里有访问,返回 3xx、4xx、5xx:抓取失败或跳转异常,先保证稳定返回 200 的最终页。

如果站点日志不方便查,也可以看索引报告里的“上次抓取时间”。没有抓取时间,或者时间很早且之后没更新,基本能判断问题在前半段。

没抓取时,先核对入口和抓取通道

已发现未抓取,常见原因不是页面“太差”,而是抓取通道太挤或入口太弱。可以按下面顺序检查:

  1. 内链入口:目标页是否从重要栏目、相关详情页获得普通链接?如果只靠 sitemap、页脚全站链接或站外少量链接,发现和抓取的优先级通常偏低。
  2. 层级深度:从首页到目标页需要点击几次?层级过深会让抓取路径变长,尤其当中间层还有大量列表页时。
  3. URL 形态:是否带排序、筛选、会话、追踪参数?同一内容出现多个地址,会分散抓取额度,也会让索引选择变难。
  4. 服务器响应:抓取时是否稳定?偶发 5xx、超时或长时间响应会降低抓取频次。
  5. sitemap 与内链是否一致:sitemap 里有 URL,但站内没有任何入口,搜索引擎仍可能把它当作低优先级内容。

这里不一定要一次全改。可以先补一两个高质量内链,观察日志里是否出现抓取,再决定下一步。

已抓取但未收录,重点回到页面本身

如果日志显示抓取正常、返回 200,但索引状态长期停在“已发现”,通常不是抓取问题,而是索引选择问题。可以从这些角度核对:

  • 正文主体是否足够:页面核心内容是否被模板、导航、推荐位和广告淹没?用户和搜索引擎都需要能快速找到主体。
  • 与站内其他页面的差异:标题、描述、正文是否和其他页面高度相似?批量生成的页面尤其容易在这里卡住。
  • 规范 URL 是否清晰:canonical 是否指向当前页,是否与分页、参数页、打印页冲突?变体越多,选中主版本的成本越高。
  • 页面类型是否有独立价值:空白筛选页、无结果页、纯标签聚合页、重复的商品变体,未必需要收录。先判断它对用户有没有独立用途。
  • 外部引用情况:有没有其他站点链接到该页?这不是收录的决定因素,但能帮助判断页面是否被需要。

处理动作不要一次全上

很多人看到“已发现”就同时提交索引、堆外链、改标题、调模板,最后不知道哪一步起了作用。更稳妥的做法是按周观察,每次只改一类:

  1. 先补内链入口,检查目标页是否从相关页面获得链接。
  2. 再核对服务器日志,确认抓取是否正常、返回码是否稳定。
  3. 然后处理重复与规范化,合并或收敛低价值变体。
  4. 最后才考虑提交索引或更新 sitemap,并继续观察日志抓取频次和索引状态。
收录状态是结果,不是开关。把“已发现”当成一条排查线索,顺着抓取和索引两条路走,比反复提交更有效。

如果页面本身是筛选页、空结果页或重复参数页,不收录可能是正常结果。先判断它是否值得被搜索用户看到,再决定是优化入口、合并内容,还是保持现状。