常见问题

入口页的链接被蜘蛛抓了,目标页还是没收录:卡点在哪、按什么顺序查

搜索蜘蛛抓取了入口页里的链接,不等于目标页会被收录。本文把发现、抓取、收录三件事拆开,列出抓到的不是最终内容、返回状态不干净、canonical 指向别处、被 noindex 拦截、页面缺少收录信号等常见卡点,并给出一套可执行的排查顺序,把注意力从入口页规模转回目标页本身。

常见问题

入口页的链接被蜘蛛抓了,目标页还是没收录:卡点在哪、按什么顺序查

入口页的作用是把 URL 送到搜索蜘蛛面前。但很多运营者会遇到一个困惑:日志里明明看到蜘蛛抓了目标页,过一段时间去查,目标页还是没进索引。这时候继续加入口页、加链接,通常不会有变化,因为问题多半不在入口页,而在目标页自身或者抓取之后的几个环节。

先把“发现、抓取、收录”三件事拆开

  • 发现:蜘蛛在入口页里读到目标页 URL,进入待抓取队列。
  • 抓取:蜘蛛真正请求了目标页,服务器日志会留下记录。
  • 收录:搜索引擎判断这个页面值得进索引,并能出现在结果里。

入口页最多只能推动前两步。第三步由目标页和整站状态决定,入口页再怎么加也没法替代。把这三件事分清之后,排查才有方向。

抓取已经发生但收录没发生:常见的几类卡点

1. 抓到的不是最终内容

如果目标页正文由 JavaScript 渲染,蜘蛛第一次抓到的可能是空壳。它会不会再走一次渲染,取决于页面重要性和渲染资源是否可用。判断方法:用抓取工具模拟不带 JS 的请求,看看返回的 HTML 里有没有正文和链接。如果关键内容只存在于 JS 里,考虑做服务端渲染或预渲染,至少保证首屏有可读内容。

2. 页面返回状态不干净

软 404 是常见问题:HTTP 状态码是 200,但页面写的是“该内容不存在”“已下架”。这类页面一般不会进索引。同样,内容极薄、大量模板重复、正文被折叠到需要交互才展开,都会让页面在索引环节被放弃。

3. 规范标签指向别的 URL

如果目标页的 canonical 指向了另一个页面,搜索引擎会把这个 URL 的内容归到那个页面上,它自己就不进索引。带参数、存在多份副本的 URL 尤其容易踩这个坑。检查时把目标页自身的 canonical、站点地图里的写法和站内链接指向的版本对照一遍,看是不是同一个地址。

4. 被 robots 规则或 meta 拦在索引之外

Disallow 影响抓取,noindex 影响收录,两者拦的阶段不一样。还有一种情况是服务端根据 UA 返回不同内容,蜘蛛拿到的版本带着 noindex,而你自己在浏览器里看不到。这种情况要按蜘蛛 UA 去请求一次才能发现。

5. 页面本身缺少值得收录的信号

没有站内入口、没有外部引用、内容和其他页面高度相似、主题和整站关系不大,这些都会让页面停留在“抓过但不收录”的状态。这不算技术故障,靠加入口页也解决不了。

建议的排查顺序

  1. 先在日志里确认蜘蛛确实抓过目标页,拿到抓取时间和返回状态码。
  2. 用不带 JS 的方式请求目标页,看返回的 HTML 里有没有正文和有效链接。
  3. 检查 HTTP 状态码、canonical、meta robots、X-Robots-Tag 是否互相一致。
  4. 看目标页内容是否和站内其他页面高度重复,是否有独立价值。
  5. 确认目标页有正常的站内入口,而不是只靠蜘蛛池入口页导过去。
  6. 以上都正常时,可以通过站点地图或提交接口把这个 URL 再提交一次,缩短重新判断的等待时间,但不要期待立刻有结果。

入口页能做什么、不能做什么

入口页擅长的是扩大 URL 的暴露面,让更多地址进入待抓取队列。它不擅长的是改变搜索引擎对目标页的价值判断。把入口页数量翻倍,往往不如把目标页的问题先修干净。

如果日志显示蜘蛛持续抓取目标页但长期不收录,优先怀疑目标页本身,而不是继续增加入口页规模。

几个容易忽略的细节

  • 目标页在入口页里的锚文本和周围文字,会影响蜘蛛对该页主题的初步判断,但不会决定它收不收录。
  • 同一目标页在多个入口页重复出现,边际收益递减,还会占用抓取额度。
  • 目标页如果是站外域名,入口页能帮上的只是发现,收录判断由那个站点自身的状态决定。
  • 抓取频率和收录速度不是线性关系,抓得多不代表收录得快。

入口页解决的是“蜘蛛知不知道这个 URL”,收录解决的是“这个 URL 值不值得进索引”。看到抓取却没收录时,把注意力从入口页挪到目标页,按上面的顺序逐项排除,通常比继续加链接更有效。