收录相关的排查最容易绕圈,是因为把三件事混在一起看:URL 有没有被发现、页面有没有被抓取、页面有没有进入索引。它们是先后关系,前一步没通,后面做多少优化都不会有变化。把链路拆成三段,问题通常很快就能定位到具体环节。
一、发现:蜘蛛是否知道这个 URL 存在
发现是收录的起点。一个 URL 如果从来没出现在蜘蛛能读到的地方,它连抓取的机会都没有。常见入口有这几类:
- 站内链接:首页、栏目页、相关推荐、上一页下一页,都能把路径和权重传下去。孤岛页面通常排在最末位。
- 站点地图:sitemap 解决的是“知道有这条 URL”,不等于“马上会抓”,也不保证收录。
- 外部链接:能带来发现机会,但抓取频次和优先级仍由站点自身情况决定。
- 其他入口:RSS、结构化数据、提交接口,作用都是同一件事——让 URL 进入待抓取队列。
核对动作:把目标 URL 放进 sitemap,同时确保站内至少有一条可点击路径指向它。两种入口都没有时,先补入口,再谈抓取。
二、抓取:蜘蛛来了,拿到的响应对不对
日志里出现蜘蛛不代表抓取成功。需要确认的是返回状态、内容是否完整、有没有被拦截。常见断点:
- 状态码:5xx 会让蜘蛛暂时放弃,429 代表请求过密,两者处理方式不同,前者查服务,后者查频次。
- robots.txt:Disallow 直接挡在抓取之前,页面即使有内链也进不来。
- 渲染:内容由前端异步加载时,要确认抓取端拿到的是完整正文还是空壳。
- 响应速度与体积:长时间不返回或体积过大,可能被中途放弃。
这一段的结论只能来自日志或抓取工具里的实际响应,而不是页面在浏览器里打开正常。
三、索引:被抓取了为什么还是不进索引
抓取成功只是拿到了内容,是否建索引还要看页面值不值得单独存在。常见原因:
- 信息增量不足:正文太薄、模板占比过高,或与站内其他页高度相似。
- 重复版本:参数、大小写、协议、尾斜杠造成多份副本,索引只会保留其中代表版本。
- 指令冲突:meta robots、canonical、HTTP 头之间给出不一致的信号。
- 页面类型本身不适合单独收录:筛选组合页、站内搜索结果页、空列表页。
抓取成功不等于收录,收录也不等于有排名。三者是三道独立关卡,分别对应入口、可访问性和页面价值。
四、建议的核对顺序
- 确认目标 URL 至少有一个内链入口,并已进入 sitemap。
- 在日志中确认该 URL 有过抓取请求,且状态码为 200。
- 核对 robots.txt 与 meta robots,排除指令层面的阻断。
- 对比抓取端拿到的正文与页面实际展示是否一致。
- 检查重复版本与内容厚度,判断它是否具备独立收录的价值。
按这个顺序走,大多数“不收录”都能落到某一环上。接下来只需针对那一环做具体处理,而不是反复提交、反复改标题。