发现、抓取、索引是三件不同的事
很多人把“提交了 URL”当成收录的第一步,其实在这之前还有一段更长的链路:蜘蛛要先发现这个 URL,再决定去抓取,抓回来之后才谈得上索引。这三步各有各的失败方式,混在一起看,就容易得出“提交没用”或“蜘蛛不抓我”这类模糊结论。
把三个环节拆开,排查才有落点:发现失败通常是入口问题,抓取失败多半是服务器或抓取额度问题,索引失败则一般要回到页面内容本身。
蜘蛛发现新 URL 的几条常见路径
- 站内链接:最常见的路径。首页、栏目页、文章相关推荐里如果都通不到,这个 URL 基本等于孤立。
- 外部链接:别人链过来时,蜘蛛顺着爬进来,链接所在页面的可抓取性同样重要。
- sitemap:它声明“我这里有这些 URL”,但只是一份候选清单,既不保证被抓,也不保证被收录。
- 推送接口:多数搜索引擎提供主动提交入口,适合新发布或刚改过的页面。
- 历史抓取记录:以前抓过的 URL 再次更新时往往会被优先回访,所以老页面改内容常常比全新页面更快被看到。
“提交了”为什么还是显示未被发现
提交只是把 URL 放进一个待处理池。真正决定它能否被发现的,是这个 URL 在站内是否有可爬到的入口、入口页面本身是否在正常被抓取、以及整站是否处在正常的访问状态。如果首页或栏目页响应异常、robots 挡住了入口、或者大量参数页把抓取额度消耗掉,提交的 URL 很可能长期排在后面。
提交解决的是“通知”,入口解决的是“能不能到”。很多等待,其实卡在后面这件事上。
被发现却长期不抓取,先看这几点
- 服务器返回是否稳定。超时、5xx、频繁跳转都会降低抓取意愿。
- URL 是否重复。同一内容靠参数、大小写、尾斜杠生成多个版本,等于自己制造了排队。
- 页面重要性信号是否足够。没有内链、没有外链、也没有历史数据的全新 URL,优先级自然靠后。
- 站点整体抓取是否被低价值页面占满,导致新页面迟迟轮不到。
抓取了却不出现在索引里
到这一步,问题基本不在入口,而在页面本身。常见原因包括:正文内容过少或与模板比例失衡,页面与其他 URL 高度相似,返回了 noindex,canonical 指向了别的地址,或者内容属于搜索引擎明确不处理的类型。抓取是拿到内容,索引是判断值不值得留,两者的标准并不相同。
一个可执行的排查顺序
- 先用日志确认蜘蛛最近是否访问过这个 URL,以及返回的状态码。
- 若没有访问记录,就先补入口:内链、sitemap、相关推荐位。
- 若有访问但状态码异常,先修服务器响应和跳转链路。
- 若返回正常但不收录,检查内容重复度、noindex、canonical 与模板占比。
- 以上都正常,就继续观察,不要反复改 URL 或重复提交,频繁改动本身会重置判断。
哪些数据更有参考价值
与其盯着某一天的收录数量,不如分开看:日志里蜘蛛的到达量和状态码分布、sitemap 里被实际访问的比例,以及索引状态中“已发现未抓取”与“已抓取未索引”各自的数量变化。前面的数字反映发现和抓取是否顺畅,后面的数字才反映内容层面的取舍。几项一起看,更容易判断问题出在哪一段。