网站收录

能抓取、能索引、能收录:用三层漏斗排查页面进不了索引

很多运营把蜘蛛访问当成收录信号,其实中间隔着可抓取、可索引、值得索引三道关。本文用漏斗思路拆解每一层常见的卡点,包括状态码、robots、noindex、canonical、渲染内容与页面质量,并给出日志、URL 检查与覆盖率报告的对照方法,帮助你判断页面到底卡在哪一步。

网站收录

能抓取、能索引、能收录:用三层漏斗排查页面进不了索引

蜘蛛来过,不等于页面会被收录。抓取、索引、收录其实是三个不同阶段,中间任何一层出问题,页面都可能停在队列里。把排查过程想成一个漏斗:先能抓,再能索引,最后才谈是否值得放进索引。

第一层:可抓取

如果蜘蛛连页面都拿不到,后面的事都不用谈。常见卡点集中在服务器与 URL 本身:

  • 状态码不稳定:间歇性 502、504 或大量 403,会让蜘蛛降低抓取频次,甚至暂时放弃这个目录。
  • robots.txt 误伤:整站屏蔽、误屏蔽 CSS/JS,或写错路径,都会让页面无法进入正常抓取流程。
  • URL 规范混乱:同一内容有带参数、大小写、尾斜杠多个版本,蜘蛛可能在变体之间来回抓,真正的主版本反而没被稳定发现。
  • 入口太少:没有内链、站点地图又没列出的 URL,蜘蛛发现得慢,甚至长期发现不了。

这一层可以用服务器日志、站点地图和 URL 检查工具对照:看蜘蛛是否真的请求了目标 URL,返回码是什么,抓的是哪个版本。

第二层:可索引

页面能被抓取,也可能被明确或隐含地排除在索引之外。重点看响应头和页面里的指令:

  • noindex:meta robots 或 X-Robots-Tag 写了 noindex,页面抓取正常,但不会进索引。
  • canonical 指向别处:页面自己声明主版本是另一个 URL,搜索引擎通常会按 canonical 收口。
  • 重复内容:站内多个 URL 内容高度相似,系统会选一个主版本,其余可能只抓不收。
  • 渲染后才有内容:首屏依赖 JS 渲染时,要确认渲染后的 HTML 里确实有正文、链接和必要的元信息。
抓取工具看到的是原始 HTML 还是渲染结果,会直接影响判断。对 JS 站点,最好用抓取测试或渲染后的 HTML 对照一次。

第三层:值得索引

能抓、也能索引,不代表页面会被放进索引。搜索引擎还要判断这个页面是否值得占一个位置。常见的“抓了不收”包括:

  • 内容太薄,只有几句话或纯参数筛选结果。
  • 与站内其他页面高度同质,仅换了排序或筛选条件。
  • 页面主题不明确,标题、正文和用户可能搜索的词对不上。
  • 聚合页、标签页大量生成,但每个页面没有独立价值。

这一层没有开关可以打开,能做的是提高页面的独立价值:补足正文、明确主题、收敛重复入口,把不值得收录的页面用 noindex 或 robots 挡在索引之外,而不是让它们消耗抓取。

怎么判断卡在哪一层

  1. 先用站点地图或内链找到目标 URL,确认蜘蛛最近是否抓过。
  2. 看日志里的返回码和抓取版本,判断可抓取层是否正常。
  3. 用 URL 检查工具看抓取时的 HTML、noindex、canonical 和渲染结果。
  4. 如果前三步都正常,再去对比同模板页面:是单个页面不收,还是一批都不收。
  5. 最后看页面质量与站内重复情况,判断是否属于“可抓但不值得收”。

三层漏斗不是一次性检查,而是一个排查顺序。先排除硬性阻断,再处理收口问题,最后才去优化内容质量。这样定位起来会比反复提交 URL 更有方向。需要说明的是,排查能减少阻碍,但没人能承诺某个页面一定被收录,最终仍由搜索引擎决定。