网站收录

爬虫天天来,页面却没进索引:抓取与收录之间的三道门槛

很多站长会遇到爬虫频繁到访、目标页面却迟迟不进索引的情况。本文把抓取和收录拆成两件事,说明从下载、内容判断到索引准入要过的三道门槛,并给出一套可照着执行的核对顺序,帮助定位问题出在抓取、内容还是索引信号上。

网站收录

爬虫天天来,页面却没进索引:抓取与收录之间的三道门槛

日志里每天都能看到某个 URL 被爬,收录却一直没动静,这种反差最容易让人误判。抓取和收录其实是两个独立环节,中间还夹着内容处理和索引准入的判断。把这两件事混在一起看,往往会去改错东西。

抓取和收录分别指什么

抓取是爬虫把页面的 HTML 以及必要的资源下载下来,这一步只说明它来了、拿到了内容。收录是抓取之后,搜索引擎判断这个页面有独立价值、可以被索引,再把它放进索引库,之后才可能出现在搜索结果里。

所以会出现几种状态:被抓了但没收录、收录了但排不出来、抓取频率很高但索引量不动。它们对应的处理动作完全不同。

从抓取到收录要过三道门槛

第一道:能不能顺利抓到

  • robots.txt 是否误屏蔽了整站目录或关键资源;
  • 返回的状态码是否稳定为 200,有没有间歇性 5xx 或超时;
  • 需要渲染的内容,原始 HTML 里是否为空;
  • 页面是否依赖登录、Cookie 或特定地域才能看到主体内容。

这一关没过,日志里要么根本不出现,要么大量报错,处理重点是让页面能被正常抓到。

第二道:抓到的内容值不值得留

爬虫抓到了,不等于内容会被保留。以下几种页面容易被判为低价值:

  • 正文只有几句话,其余全是导航、推荐位和广告;
  • 同一批内容在不同 URL 下反复出现,没有 canonical 或参数处理;
  • 列表页、标签页、站内搜索结果页大量生成相似结构;
  • 内容由模板拼接,换个关键词就当成一篇新页面。

处理重点是让每个 URL 承载独立信息,而不是继续增加相似页面。

第三道:处理之后能不能进索引

内容本身没问题,也可能因为信号冲突被挡住:

  • 页面上的 canonical 指向了另一个更完整的版本,本页会以那个 URL 的形式入索引;
  • HTTP 头或页面里的 noindex 没有清理干净,是从测试环境带过来的;
  • 多个变体(带参数、带尾斜杠、大小写不同)被合并,只保留一个代表 URL;
  • 站点整体质量偏低时,新页面的收录速度和比例都会明显下降。
判断问题的顺序应该是:先确认被抓到,再看内容是否值得留,最后检查索引信号是否一致。跳过前两步直接改代码,通常是在治标。

一个可以照着走的核对顺序

  1. 在服务器日志或抓取统计里确认该 URL 是否真的被请求过,返回码是什么。
  2. 把日志按页面类型分组,看是详情页不收录,还是列表页、筛选页也在里面,问题范围会立刻缩小。
  3. 抓取原始 HTML(关闭 JS 或用抓取工具查看),确认主体内容在不在。
  4. 检查 robots、meta robots、X-Robots-Tag、canonical 四个信号是否互相一致。
  5. 对比同栏目下已被收录的页面,找出结构、长度、内容上的差别。
  6. 确认无误后,用站内入口链接、Sitemap 提交等方式重新暴露 URL,然后耐心观察,不要反复提交。

常见的两个误判

一是看到抓取频繁就以为快收录了。抓取频率更多反映爬虫对站点的信任度和更新预期,和单个页面能否入索引没有直接关系。

二是看到索引量没涨就去堆外链。如果页面本身过不了第二道门槛,外链只会带来更多抓取,不会自动带来收录。

小结

抓取是入口,收录是结果,中间隔着内容质量与索引信号的判断。遇到爬虫来了但不收录,先把两个数字分开,再顺着抓取、内容、索引信号这条线逐段核对,比盲目修改页面要有效得多。