网站收录

页面被收录却没排上:把抓取、收录、排名拆开看

很多站长把抓取、收录、排名当成一件事:搜不到页面就统一归因为没收录,然后反复提交 sitemap、加内链。本文把三个环节拆开讲,说明怎样用服务器日志、索引检查和具体查询判断页面卡在哪一步,收录之后仍然没有位置时的常见原因,以及确认未收录后该按什么顺序排查。

网站收录

页面被收录却没排上:把抓取、收录、排名拆开看

很多人判断一个页面有没有“进”搜索引擎,习惯直接搜一下。搜不到,就认定“没收录”,然后去折腾 sitemap、加内链、找提交入口。但从蜘蛛看到 URL 到页面出现在结果页,中间隔着几个环节,卡在哪一步,处理方式完全不同。把抓取、收录、排名混为一谈,最容易做无用功。

抓取、收录、排名,是三个不同的环节

可以先这样区分:

  • 抓取:蜘蛛请求了你的 URL 并拿到响应内容。服务器日志里能看到它的访问记录。
  • 收录:搜索引擎对抓到的内容做了处理,判定值得放进索引库。这一步在日志里看不到痕迹。
  • 排名:用户在某个具体查询下,搜索引擎从索引中挑出候选页面并排序。同一个页面在不同词下的表现可以相差很大。

抓取是收录的前提,收录是排名的前提,但每一步都不是必然发生。被抓不等于被收录,被收录也不等于有位置。

先判断页面停在哪一步

看日志:蜘蛛来没来

如果日志里连访问记录都没有,问题出在发现和抓取环节:内链是否可达、robots 是否放行、有没有外链或 sitemap 提供入口。如果日志里反复出现同一个 URL,但都是低优先级抓取,那说明它已经被发现,只是还没轮到被处理。

看索引:有没有入库

用站点查询或搜索控制台里的 URL 检查,可以大致判断页面是否在索引中。注意两者口径不同,数字对不上很正常。索引检查里出现的“已抓取,当前未收录”是一个明确的中间状态——说明抓过了,但没通过收录这一关。

看具体查询:有没有被调用

收录了不等于有位置。更可靠的做法是挑一个页面的核心词去搜,看它是否出现。如果查不到,先确认这个词本身有没有真实搜索需求,再换更长的长尾词试一次。

收录了却没有位置,通常不是收录问题

  • 查询本身搜索量太小,或者只是你内部习惯的叫法。
  • 页面主题和查询意图不匹配,标题和正文没有正面回答这个问题。
  • 站内存在多个相似页面,信号被分散,谁都不容易上去。
  • 内容深度和完整度不足,用户点进来解决不了问题。
  • 页面能被索引,但在高相关场景下很少被调用。

这些都偏内容和匹配层面。再去提交 sitemap、反复请求抓取,基本不会有变化。

如果确认是没收录,按这个顺序查

  1. 确认 URL 返回 200,正文内容在初始 HTML 里就能看到,不是空壳。
  2. 确认 meta robots 和响应头里没有 noindex,robots.txt 没有拦住这个路径。
  3. 确认页面有可爬取的入口:内链、导航、sitemap 至少有一条通路。
  4. 确认它不是和其它页面高度重复的版本,canonical 指向的是该保留的那一版。
  5. 确认站点整体抓取正常,蜘蛛没有因为响应慢或频繁报错而降低访问频率。

一步一步排除,比同时改十处配置更容易看出是哪一环出了问题。

别把收录数量当成唯一指标

收录数是入门指标,不是结果指标。收录比例高但页面都不对应真实需求,整体表现不会好;反过来,收录数不多但每个页面都精准命中某类查询,同样能带来稳定访问。定期观察收录率的变化有意义,但看到一个数字波动就大规模改站,通常不划算。

收录只是把页面放进了候选池,能不能被调出来,取决于它和用户查询的匹配程度。排查时先确定卡在哪一步,再动对应的地方。