蜘蛛来过,不等于页面会被收录。抓取、索引、收录其实是三个不同阶段,中间任何一层出问题,页面都可能停在队列里。把排查过程想成一个漏斗:先能抓,再能索引,最后才谈是否值得放进索引。
第一层:可抓取
如果蜘蛛连页面都拿不到,后面的事都不用谈。常见卡点集中在服务器与 URL 本身:
- 状态码不稳定:间歇性 502、504 或大量 403,会让蜘蛛降低抓取频次,甚至暂时放弃这个目录。
- robots.txt 误伤:整站屏蔽、误屏蔽 CSS/JS,或写错路径,都会让页面无法进入正常抓取流程。
- URL 规范混乱:同一内容有带参数、大小写、尾斜杠多个版本,蜘蛛可能在变体之间来回抓,真正的主版本反而没被稳定发现。
- 入口太少:没有内链、站点地图又没列出的 URL,蜘蛛发现得慢,甚至长期发现不了。
这一层可以用服务器日志、站点地图和 URL 检查工具对照:看蜘蛛是否真的请求了目标 URL,返回码是什么,抓的是哪个版本。
第二层:可索引
页面能被抓取,也可能被明确或隐含地排除在索引之外。重点看响应头和页面里的指令:
- noindex:meta robots 或 X-Robots-Tag 写了 noindex,页面抓取正常,但不会进索引。
- canonical 指向别处:页面自己声明主版本是另一个 URL,搜索引擎通常会按 canonical 收口。
- 重复内容:站内多个 URL 内容高度相似,系统会选一个主版本,其余可能只抓不收。
- 渲染后才有内容:首屏依赖 JS 渲染时,要确认渲染后的 HTML 里确实有正文、链接和必要的元信息。
抓取工具看到的是原始 HTML 还是渲染结果,会直接影响判断。对 JS 站点,最好用抓取测试或渲染后的 HTML 对照一次。
第三层:值得索引
能抓、也能索引,不代表页面会被放进索引。搜索引擎还要判断这个页面是否值得占一个位置。常见的“抓了不收”包括:
- 内容太薄,只有几句话或纯参数筛选结果。
- 与站内其他页面高度同质,仅换了排序或筛选条件。
- 页面主题不明确,标题、正文和用户可能搜索的词对不上。
- 聚合页、标签页大量生成,但每个页面没有独立价值。
这一层没有开关可以打开,能做的是提高页面的独立价值:补足正文、明确主题、收敛重复入口,把不值得收录的页面用 noindex 或 robots 挡在索引之外,而不是让它们消耗抓取。
怎么判断卡在哪一层
- 先用站点地图或内链找到目标 URL,确认蜘蛛最近是否抓过。
- 看日志里的返回码和抓取版本,判断可抓取层是否正常。
- 用 URL 检查工具看抓取时的 HTML、noindex、canonical 和渲染结果。
- 如果前三步都正常,再去对比同模板页面:是单个页面不收,还是一批都不收。
- 最后看页面质量与站内重复情况,判断是否属于“可抓但不值得收”。
三层漏斗不是一次性检查,而是一个排查顺序。先排除硬性阻断,再处理收口问题,最后才去优化内容质量。这样定位起来会比反复提交 URL 更有方向。需要说明的是,排查能减少阻碍,但没人能承诺某个页面一定被收录,最终仍由搜索引擎决定。