很多站点检查收录时,习惯先看蜘蛛抓取日志。看到新URL被访问过,就默认页面很快会进索引;过几天搜索里找不到,又怀疑内容质量或站点权重。其实抓取、索引和展示是三个不同阶段,中间任何一步没处理好,都可能让页面停在半路。
抓取、索引、展示各管一段
蜘蛛访问URL,只代表它知道了这个地址,并且愿意来取一次内容。取到内容之后,搜索引擎还要判断这个页面是否值得进入索引、应该保留哪个URL版本、在什么情况下展示。抓取正常但收录慢,并不一定是蜘蛛没来。
- 抓取:蜘蛛请求URL并获取响应,可能只是发现,也可能是定期回访。
- 索引:搜索引擎把页面内容处理后存入可检索的库,并确定代表版本。
- 展示:用户搜索时,从索引中选出页面并排序展示,这一步还受查询词和竞争影响。
把这三步混在一起看,容易得出错误结论。比如日志里抓取频繁,就说“收录没问题”;搜索里没有,就说“内容太差”。更稳妥的做法是按阶段核对。
第一步:确认蜘蛛抓到的是哪个URL
同一个页面如果存在多个可访问地址,比如带参数、带大小写、带www与不带www、带结尾斜杠与不带斜杠,蜘蛛可能分别抓取,但索引里通常只会保留一个代表版本。站点需要先明确希望哪个URL被收录。
- 页面是否只有一个规范URL,其他版本是否通过301或canonical指向它;
- robots.txt是否误屏蔽了重要目录或参数;
- 站点地图和内链是否主要指向规范版本,而不是把权重分散到多个副本;
- 分页、筛选、排序参数是否产生了大量低价值URL。
如果URL规范没做好,蜘蛛可能抓了很多重复版本,但索引里只留一个,甚至因为版本摇摆而暂时不收录。这时优先整理URL,而不是急着加内容。
第二步:看页面有没有“可索引”的内容
被抓取不代表内容值得索引。页面如果主要由模板、推荐位、广告或重复文案组成,正文信息很少,搜索引擎可能抓取后不保留。页面质量不是抽象分数,通常可以从可见内容、独立价值和重复程度判断。
- 页面是否有独立于其他页面的主要信息,而不是只换了标题和几张图;
- 正文是否被大量重复的列表、标签、相关推荐淹没;
- 同一主题是否拆成了多个高度相似的URL,互相竞争;
- 内容是否完整可读,不依赖登录、弹窗或脚本才能看到关键信息。
如果多个页面讲的是同一件事,先考虑合并或明确主从关系。重复内容不一定会被惩罚,但会让搜索引擎难以判断该收录哪一版,收录速度也容易变慢。
第三步:核对索引里保留的版本
有时页面不是没进索引,而是索引里保留的是另一个URL版本。比如移动版、参数版、AMP版或旧版地址。站点在搜索里查不到目标URL,就以为没收录,实际可能是代表版本换了。
可以用站点地图和canonical交叉检查:站点地图提交的URL、页面声明的canonical、内链指向的URL,是否一致。如果这三处指向不同版本,搜索引擎需要额外判断,收录和展示都可能延迟。
抓取不等于收录,收录也不等于排名。排查时先分清阶段,能减少很多无效改动。
一个实用的排查顺序
- 先从抓取日志或搜索资源平台确认蜘蛛是否访问过目标URL;
- 检查该URL是否可正常访问,返回码是否稳定,robots.txt是否允许抓取;
- 确认页面canonical和站点地图是否指向同一规范版本;
- 查看页面正文是否有独立、完整、可读的信息;
- 检查站内是否存在多个相似URL,必要时合并或设置规范版本;
- 最后再观察索引状态变化,不要频繁改动URL和内容。
收录是抓取、索引和展示共同作用的结果。站点能控制的主要是URL规范、内容质量和站内入口。把这些基础整理清楚,比反复猜测蜘蛛行为更有用。