在收录相关的讨论里,有一个问题经常被混在一起:后台显示页面已收录,site: 查询也能看到这个 URL,可换成页面标题或核心词去搜,翻了几页都找不到。于是有人判断掉收录了,又去重新提交、改标题、补内容,折腾一圈,状态没变,人先累了。
把这件事拆开看会清楚很多:在索引里和因为某个查询被检索出来,其实是流水线上两个不同的环节。
索引状态和检索结果是两回事
抓取、索引、检索是三道不同的工序。抓取是蜘蛛把页面内容取回来;索引是系统判断这个页面值不值得留档、按什么主题存进库;检索则是面对一个具体查询时,从库里挑出它认为最合适的若干结果并排序。
索引状态回答的是这个 URL 在库里有没有记录;检索结果回答的是针对这组关键词,库里哪些页面值得拿出来。前者是存在与否,后者是排不排得出来。一个页面可以稳稳待在索引里,同时在任何实际搜索中都不出现,这本身不算异常。
收录了却搜不到的几种常见原因
查询词和页面内容对不上
最容易被忽略的一条。你搜的词可能只出现在页面的一小块文字里,或者是你自己习惯的说法,页面上从来没写过。引擎能做的匹配是有边界的,它不会替你联想。先用正文里确实存在的原句去搜,如果原句能搜到,说明索引里的内容没问题,只是关键词选得不对。
同类页面太多,系统只挑一个代表
当一个站点里存在多个主题高度接近的页面——同一产品的不同型号、同一活动的多个落地页、正文几乎一致只换了标题的几篇——系统通常会从这组里选一个作为代表参与检索,其余页面仍然留在索引中,但很少被拿出来。这大概是收录了却搜不到最常见的形态。判断方法很简单:搜核心词,看出现的那一个是不是同组里的另一个页面。
页面进了索引,但没通过展示门槛
索引的门槛比展示的门槛低。内容拼凑、信息量不足以回答任何具体问题、主要靠模板撑起来的页面,可以留在库里,但不一定有机会出现在结果页。这类页面要解决的是页面本身有没有东西可说,而不是收录问题。
查询本身带地域、时间或意图倾向
同一组词,不同的人、不同的设备、不同的位置搜出来的结果可能不一样。如果在自己的环境里翻不到,可以先确认这个页面在别的查询下是否出现,再判断是不是检索环境造成的差异。
一个可以照着走的自查顺序
- 用 site:域名/具体路径 确认这个 URL 是否在索引里,注意带上完整路径,而不是只查首页。
- 复制页面上连续的一整句话去搜,验证索引里的内容和线上内容是否一致。
- 用页面最核心的词去搜,看出现的是不是同一组里的另一个 URL。如果是,问题在重复,不在收录。
- 检查页面是否带 noindex、是否被 robots 屏蔽、主体内容是否需要登录才能看到。
- 看这个页面在内链里有没有稳定入口,以及它和同组页面的关系有没有说清楚。
- 如果以上都正常,先放一段时间,不要因为一次查询没出现就反复改标题和正文。
什么情况下不用处理
首页、栏目页、聚合页这类页面,承担的职责是导航和分发,而不是靠某个具体关键词被搜到。它们安安静静待在索引里、不参与检索,是正常状态。真正需要盯的是那些本应靠内容被搜到的页面,如果长期搜不出来,才值得回到内容质量和重复度上去找原因。
收录是入场券,不是座位号。页面在库里,只说明它有机会被考虑;能不能被搜到、排在哪里,取决于它面对具体问题时有没有东西可说。