网站收录

能被抓取不等于会被收录:中间隔着一道质量判断

蜘蛛访问并返回 200,只是把页面取回服务器;能不能进索引,还要过 robots、noindex、重复内容、页面价值等多道判断。本文把抓取和收录拆开看,说明卡点通常出现在哪一段,以及索引状态报告里的几种提示各自在说什么,方便按顺序排查。

网站收录

能被抓取不等于会被收录:中间隔着一道质量判断

抓取和收录常被当成一回事,但在搜索系统里它们是两个阶段。抓取(crawl)只是蜘蛛把页面的 HTML 取回服务器;收录(index)是这个 URL 进入索引库,之后才有可能被检索和展示。服务器日志里全是 200,并不代表页面就在索引里。

抓取完成之后,还可能停在几道门口

从取回到进索引,中间通常还有几层判断。任何一层没过,页面就会停在门外,而且日志上看起来一切正常。

第一道:能不能抓到

  • robots.txt 里屏蔽了对应目录或整站;
  • 服务器返回 403、503、超时或频繁重置连接;
  • 页面内容依赖登录、表单提交或本地存储才能出现。

这一层的问题会在抓取日志里留下痕迹:访问次数少、状态码异常、爬取深度浅。

第二道:页面自己说不想被收录

  • HTML 里的 noindex meta 标签;
  • HTTP 响应头里的 noindex;
  • 被 canonical 指向了另一个页面,自己成了备用版本。

这些是页面主动的表态,抓取照常发生,但收录会被跳过。它们不写在 robots.txt 里,所以只查 robots 是查不出来的。

第三道:和已有内容太像

如果同一篇内容在站内有多个版本,或者被大量转载、聚合,系统需要在其中挑一个代表。挑剩下的页面,即使被抓取过,也可能只作为备用版本存在,不会单独获得索引位置。

第四道:值不值得单独占一个位置

模板撑起来、正文几乎没有信息量的页面,抓取通常顺利,收录却长期停住。这不是技术问题,而是页面本身没提供可被检索的独立内容。

索引状态报告里的提示在说什么

  • 已发现,尚未抓取:URL 已经知道,但还没轮到抓取,常见于新站或内链入口太少的页面。
  • 已抓取,尚未编入索引:抓到了,但没有收录。这一档最需要看内容质量、重复情况和页面价值。
  • 已编入索引:进入了索引库,但具体有没有排名、有没有搜索流量,是另一个问题。
  • 重复网页,系统选择的规范网页与用户指定的不同:页面的规范信号和系统判断不一致,需要检查站内是否有更完整的同类页面。
  • 已排除,被 noindex 标记:页面自己拦掉了收录。
  • 备用网页(有规范标签):canonical 生效了,当前 URL 让位给另一个地址。

把提示对应到具体那一道门,排查方向就清楚了:是没抓到、是不让收、还是抓到了但被判定为不值得收。

可以按这个顺序排查

  1. 先在抓取日志或站长平台的抓取统计里,确认蜘蛛真的来过这个地址,且返回的是正常状态码。
  2. 查看页面源代码和响应头,确认没有 noindex。
  3. 检查 canonical 指向哪里,是否指向了别的地址。
  4. 和站内同类页面比对,看正文是否存在大段重复。
  5. 判断页面有没有独立信息量:是为了填模板生成的,还是真的回答了一个具体问题。
  6. 确认这个地址有内链或站点地图入口,而不是只能靠外链才能被找到。

抓取正常、收录迟迟不来,常见的原因

  • 站点整体权重和信任度还在积累期,新页面被收录的节奏偏慢;
  • 同类内容在站内已经有很多,新增的差异化不足;
  • 页面入口太深,只有深层链接,缺少从首页或栏目页过来的路径;
  • 页面正文需要额外渲染才能出现,初次抓取时拿到的内容很单薄。
一句话概括:抓取解决的是“能不能看到”,收录解决的是“值不值得存下来”。两件事分开看,排查时才不会在错误的方向上反复调整。

遇到页面没有收录时,先别急着改标题或堆关键词。按上面的顺序确认它卡在哪一段:是没被抓到,是被页面自己拦住,还是抓到了但没通过价值判断。定位准确之后,改动才会有针对性。