很多人判断一个页面有没有“进”搜索引擎,习惯直接搜一下。搜不到,就认定“没收录”,然后去折腾 sitemap、加内链、找提交入口。但从蜘蛛看到 URL 到页面出现在结果页,中间隔着几个环节,卡在哪一步,处理方式完全不同。把抓取、收录、排名混为一谈,最容易做无用功。
抓取、收录、排名,是三个不同的环节
可以先这样区分:
- 抓取:蜘蛛请求了你的 URL 并拿到响应内容。服务器日志里能看到它的访问记录。
- 收录:搜索引擎对抓到的内容做了处理,判定值得放进索引库。这一步在日志里看不到痕迹。
- 排名:用户在某个具体查询下,搜索引擎从索引中挑出候选页面并排序。同一个页面在不同词下的表现可以相差很大。
抓取是收录的前提,收录是排名的前提,但每一步都不是必然发生。被抓不等于被收录,被收录也不等于有位置。
先判断页面停在哪一步
看日志:蜘蛛来没来
如果日志里连访问记录都没有,问题出在发现和抓取环节:内链是否可达、robots 是否放行、有没有外链或 sitemap 提供入口。如果日志里反复出现同一个 URL,但都是低优先级抓取,那说明它已经被发现,只是还没轮到被处理。
看索引:有没有入库
用站点查询或搜索控制台里的 URL 检查,可以大致判断页面是否在索引中。注意两者口径不同,数字对不上很正常。索引检查里出现的“已抓取,当前未收录”是一个明确的中间状态——说明抓过了,但没通过收录这一关。
看具体查询:有没有被调用
收录了不等于有位置。更可靠的做法是挑一个页面的核心词去搜,看它是否出现。如果查不到,先确认这个词本身有没有真实搜索需求,再换更长的长尾词试一次。
收录了却没有位置,通常不是收录问题
- 查询本身搜索量太小,或者只是你内部习惯的叫法。
- 页面主题和查询意图不匹配,标题和正文没有正面回答这个问题。
- 站内存在多个相似页面,信号被分散,谁都不容易上去。
- 内容深度和完整度不足,用户点进来解决不了问题。
- 页面能被索引,但在高相关场景下很少被调用。
这些都偏内容和匹配层面。再去提交 sitemap、反复请求抓取,基本不会有变化。
如果确认是没收录,按这个顺序查
- 确认 URL 返回 200,正文内容在初始 HTML 里就能看到,不是空壳。
- 确认 meta robots 和响应头里没有 noindex,robots.txt 没有拦住这个路径。
- 确认页面有可爬取的入口:内链、导航、sitemap 至少有一条通路。
- 确认它不是和其它页面高度重复的版本,canonical 指向的是该保留的那一版。
- 确认站点整体抓取正常,蜘蛛没有因为响应慢或频繁报错而降低访问频率。
一步一步排除,比同时改十处配置更容易看出是哪一环出了问题。
别把收录数量当成唯一指标
收录数是入门指标,不是结果指标。收录比例高但页面都不对应真实需求,整体表现不会好;反过来,收录数不多但每个页面都精准命中某类查询,同样能带来稳定访问。定期观察收录率的变化有意义,但看到一个数字波动就大规模改站,通常不划算。
收录只是把页面放进了候选池,能不能被调出来,取决于它和用户查询的匹配程度。排查时先确定卡在哪一步,再动对应的地方。