网站收录

日志里全是 200,索引里却没几条:抓取与收录不是一回事

服务器日志里蜘蛛抓取频繁、返回 200,并不等于页面已经进入索引。抓取只是第一步,后面还有解析、渲染、去重、质量判断和规范选择。本文梳理抓取与收录的区别、常见误判和自查顺序,帮助站点把精力放在真正影响索引的环节上。

网站收录

日志里全是 200,索引里却没几条:抓取与收录不是一回事

抓取和收录,中间隔着好几道门

很多人看服务器日志,发现搜索蜘蛛来得很勤,返回状态码大多是 200,就默认这些页面已经被收录。实际上,抓取和收录是两件事。抓取更像“把页面下载回去”,收录是“判断这个页面值不值得放进索引,并把它整理成可检索的版本”。

蜘蛛抓走一个 URL,只代表它拿到了内容。之后还要经过解析、渲染、识别规范地址、去重、质量评估和索引选择。任何一步不通过,页面都可能停在索引之外。

日志里的抓取量,不能直接当成收录量。抓得多,只能说明蜘蛛愿意来;收不收,是另一套判断。

为什么抓了很多,索引里却没几条

1. 抓取成功,但页面本身不可索引

返回 200 不代表页面允许被索引。常见情况包括:页面带有 noindex 标签;canonical 指向了另一个地址;内容被登录墙或弹窗遮住;主要正文要点击多次才出现;robots 元标签阻止索引。这些页面可以被正常抓取,但不会进入索引。

2. 抓取后判定为重复或低价值

筛选页、排序页、参数页、空结果页、模板化聚合页,往往会被抓取,但搜索引擎不一定收录。它们和主页面内容高度相似,或者自身没有独立信息。抓取它们是为了比较和确认,不是承诺给每个 URL 一个索引位置。

3. 抓到的不是规范版本

同一个页面可能有多个地址:带 www 和不带 www、http 和 https、带追踪参数和不带参数、PC 版和移动版。蜘蛛可能都抓,但最后只会选一个作为索引代表。其他版本即使被抓过,也可能不单独收录。

4. 索引选择:同主题只留一个

当站内存在多个近似页面时,搜索引擎会判断哪一个最合适。它可能收录 A,不收录 B;也可能把 B 的内容折叠到 A 下面。抓取 B 并不等于 B 会独立出现在搜索结果里。

自查顺序:先看抓取,再看索引,最后看选择

  1. 看日志:哪些 URL 被抓取,状态码是什么,抓取频率是否集中在重要页面,是否大量消耗在无意义地址上。
  2. 看索引状态:用 URL 检查工具或索引报告,区分“已发现未抓取”“已抓取未索引”“已索引”和“被排除”。不同状态对应不同问题。
  3. 看页面质量与重复:正文是否完整,是否有独特信息,是否和站内其他页面高度相似,是否有多个版本在互相竞争。
  4. 看内链与入口:重要页面有没有稳定入口,是否只靠 sitemap 提交,是否处在很深的层级里。
  5. 看规范信号:canonical、robots、sitemap、状态码是否一致。信号互相矛盾时,蜘蛛容易抓错版本,索引也容易选错地址。

能做和不能做的事

能做的,是让值得收录的页面更容易被抓到、被正确解析、被清楚识别,并且和其他页面形成内容差异。不能做的,是保证某个页面一定被收录,或者一定获得排名。抓取量高不是目标,索引里有用的页面才是。

如果日志里 200 很多、索引里却很少,不要急着加蜘蛛或堆链接。先把页面分成“值得索引”和“不值得索引”两类,再检查不可索引的原因、重复版本和规范信号。顺序对了,排查会清楚很多。

小结

抓取是过程,收录是结果。日志里的 200 只能说明蜘蛛来过,不能说明页面已经进入索引。把抓取、索引和展示分开看,很多“收录不好”的问题会更容易定位。