网站收录

抓取和收录不是一回事:把三个环节分开看,排查方向才不跑偏

很多站点问题被笼统归成“没收录”,实际可能卡在抓取、索引或展现中的某一环。本文把这三个环节拆开讲,说明各自的判断依据、常见卡点,以及排查时该先看哪一层数据,避免一上来就改内容或反复提交。

网站收录

抓取和收录不是一回事:把三个环节分开看,排查方向才不跑偏

在站点运营的日常沟通里,“页面没收录”几乎是最常出现的一句话。但如果把日志和索引状态摊开来看,会发现其中相当一部分问题并不在收录这一环——有的页面压根没被抓取,有的抓了但内容被判为低价值,还有的已经进了索引只是没排到用户能看见的位置。把这三件事混成一句话,排查就会失焦。

抓取、索引、展现:三个环节各管什么

可以把它理解成一条流水线:搜索引擎先发现 URL,再派爬虫把页面内容取回来,这是抓取;取回的内容经过解析、去重、质量判断后决定是否留下,这是索引;用户搜索时从索引里挑出匹配结果并排序,这是展现。三个环节的输入输出完全不同,出问题时的表现也不一样。

  • 抓取层关心的是:这个 URL 被发现了吗?爬虫来过吗?返回的是 200 还是 404、301?
  • 索引层关心的是:内容被留下了吗?留的是哪个 URL?有没有被判定为重复而合并?
  • 展现层关心的是:这个词有没有机会出现?出在什么位置?

站内能直接拿到证据的是前两层。日志、站点地图、抓取统计、索引状态,都属于可以用数据说话的范围;展现层受外部竞争影响大,不适合作为判断收录是否正常的唯一依据。

为什么“抓到了”不等于“进了索引”

爬虫来访问页面,只说明它完成了取回动作,并不代表内容会被保留。取回之后还有几道判断:页面是否和已有内容高度重合、正文是不是几乎为空、模板部分是否远多于主体内容、这个 URL 是否属于同一页面的另一个变体。任何一条不过关,都可能出现“抓取正常、索引没有”的状态。

反过来也成立:有些页面没有被抓取,却因为外链锚文本或历史信号出现在索引里。这时如果只盯着日志看,会得出“没抓取所以没收录”的结论,但实际情况是索引里已经有了一条可能过期的记录,需要区分处理。

常被混在一起的几个迹象

  • 日志里访问次数很多,就认为收录一定好——高频抓取可能集中在少数几个页面或参数地址上。
  • 提交了 sitemap 就等收录——提交只是提供了发现入口,后面还要过抓取和索引两道关。
  • 索引状态显示“已发现但未抓取”,就当成收录失败——它其实停在抓取层的排队阶段。
  • 看到索引里有这条 URL,就以为内容就是自己现在这一版——索引里的版本可能还停留在旧内容。

排查时怎么把两层分开

  1. 先确认 URL 是否被正常返回。用站点抓取工具或日志确认状态码,排除跳转链、参数错误、robots 拦截这类基础问题。
  2. 再看抓取是否真的发生。查日志里的访问记录,注意区分是列表页被频繁抓取,还是目标详情页根本没被访问过。
  3. 抓取正常但没索引时,回到内容本身。看正文是否完整、是否与同站其他页面大量重合、是否只是筛选或排序产生的变体地址。
  4. 索引里有但内容不对时,检查是否属于版本滞后。确认页面主体是否发生过较大改动,以及改动是否值得重新触发一次抓取。
  5. 确认处理方式是否互相冲突。比如一边想让它进索引,一边 robots.txt 又挡住了抓取,这种组合往往会让状态停在中间态。
一个简单的判断习惯:先问“爬虫来过没有”,再问“来过之后留下了什么”。这两个问题的答案都拿到,讨论才有着落。

什么时候该盯抓取,什么时候该盯收录

当目标是让新页面尽快被发现时,重点在抓取层:内链位置、目录深度、sitemap 是否包含、入口是否被屏蔽。当目标是让已有页面稳定留在索引里时,重点在索引层:内容是否足够独立、URL 是否唯一、变体是否收敛、页面是否经常出现长时间空白或报错。

把这两个目标分开之后,很多“收录问题”会自然落到具体一层。此时再决定是调整内链、收敛参数、合并重复页面,还是补充正文,方向会清楚得多,也不必反复提交同一批 URL 来求安心。