网站收录

发现、抓取、索引:URL 从提交到收录要过的三道关

提交 URL 只是通知,蜘蛛要先发现入口、再决定抓取、最后才判断是否值得进入索引。本文把这三个环节拆开,说明每一步常见的卡点、可执行的排查顺序,以及日志与索引状态数据该怎么配合着看。

网站收录

发现、抓取、索引:URL 从提交到收录要过的三道关

发现、抓取、索引是三件不同的事

很多人把“提交了 URL”当成收录的第一步,其实在这之前还有一段更长的链路:蜘蛛要先发现这个 URL,再决定去抓取,抓回来之后才谈得上索引。这三步各有各的失败方式,混在一起看,就容易得出“提交没用”或“蜘蛛不抓我”这类模糊结论。

把三个环节拆开,排查才有落点:发现失败通常是入口问题,抓取失败多半是服务器或抓取额度问题,索引失败则一般要回到页面内容本身。

蜘蛛发现新 URL 的几条常见路径

  • 站内链接:最常见的路径。首页、栏目页、文章相关推荐里如果都通不到,这个 URL 基本等于孤立。
  • 外部链接:别人链过来时,蜘蛛顺着爬进来,链接所在页面的可抓取性同样重要。
  • sitemap:它声明“我这里有这些 URL”,但只是一份候选清单,既不保证被抓,也不保证被收录。
  • 推送接口:多数搜索引擎提供主动提交入口,适合新发布或刚改过的页面。
  • 历史抓取记录:以前抓过的 URL 再次更新时往往会被优先回访,所以老页面改内容常常比全新页面更快被看到。

“提交了”为什么还是显示未被发现

提交只是把 URL 放进一个待处理池。真正决定它能否被发现的,是这个 URL 在站内是否有可爬到的入口、入口页面本身是否在正常被抓取、以及整站是否处在正常的访问状态。如果首页或栏目页响应异常、robots 挡住了入口、或者大量参数页把抓取额度消耗掉,提交的 URL 很可能长期排在后面。

提交解决的是“通知”,入口解决的是“能不能到”。很多等待,其实卡在后面这件事上。

被发现却长期不抓取,先看这几点

  1. 服务器返回是否稳定。超时、5xx、频繁跳转都会降低抓取意愿。
  2. URL 是否重复。同一内容靠参数、大小写、尾斜杠生成多个版本,等于自己制造了排队。
  3. 页面重要性信号是否足够。没有内链、没有外链、也没有历史数据的全新 URL,优先级自然靠后。
  4. 站点整体抓取是否被低价值页面占满,导致新页面迟迟轮不到。

抓取了却不出现在索引里

到这一步,问题基本不在入口,而在页面本身。常见原因包括:正文内容过少或与模板比例失衡,页面与其他 URL 高度相似,返回了 noindex,canonical 指向了别的地址,或者内容属于搜索引擎明确不处理的类型。抓取是拿到内容,索引是判断值不值得留,两者的标准并不相同。

一个可执行的排查顺序

  1. 先用日志确认蜘蛛最近是否访问过这个 URL,以及返回的状态码。
  2. 若没有访问记录,就先补入口:内链、sitemap、相关推荐位。
  3. 若有访问但状态码异常,先修服务器响应和跳转链路。
  4. 若返回正常但不收录,检查内容重复度、noindex、canonical 与模板占比。
  5. 以上都正常,就继续观察,不要反复改 URL 或重复提交,频繁改动本身会重置判断。

哪些数据更有参考价值

与其盯着某一天的收录数量,不如分开看:日志里蜘蛛的到达量和状态码分布、sitemap 里被实际访问的比例,以及索引状态中“已发现未抓取”与“已抓取未索引”各自的数量变化。前面的数字反映发现和抓取是否顺畅,后面的数字才反映内容层面的取舍。几项一起看,更容易判断问题出在哪一段。