在搜索控制台的页面索引报告里,除了“已发现,尚未抓取”和“已编入索引”,还有一类状态常被忽略:已抓取,尚未编入索引。它和前者不是一回事——蜘蛛已经把页面拿回去了,只是索引系统没有把这份内容放进去。
三种状态,卡住的位置不同
- 已发现,尚未抓取:URL 被知道了,蜘蛛还没来,问题出在抓取调度。
- 已抓取,尚未编入索引:内容已经拿回,问题出在索引阶段的判断。
- 已编入索引:进入索引,才有机会出现在结果里,能不能排上去是另一回事。
把这两类混着看,很容易做错动作。前者该改内链、改 sitemap、调整抓取优先级;后者再怎么提交 URL,也不会直接改变索引系统的判断。
内容拿回去了,索引为什么不收
1. 页面没有提供新的东西
常见的情况是同一批页面结构几乎一样,只换了几个词、商品名或者城市名。索引系统会把它们归成相近的模板页,留下一部分作为代表,其余的长期停留在已抓取未编入索引。
2. 站内低质页面占比过高
索引是讲取舍的。当一个目录下大量页面本身就不值得收录时,新页面被压着不进索引的概率也会变高。这不是单个页面的问题,而是整体信号在起作用。
3. 正文没被拿到:渲染或结构问题
如果主体内容依赖 JavaScript 才能显示,或者被折叠、被登录墙挡住,蜘蛛抓到的可能只是一个空壳。状态看着是已抓取,实际拿到的内容不足以做判断。
4. 刚发布,还在排队
新页面从抓取到进入索引本身有一段延迟,站点规模大、更新频繁时更明显。几天内的状态波动,不必太早下结论。
自查顺序
- 用 URL 检查工具看实际抓取到的 HTML,确认正文是否完整、有没有被脚本挡住。
- 检查规范标签是否指向自己,有没有误指向别的 URL,或者被别的页面反向指定。
- 看同目录下有多少结构相近的页面,判断是否存在大量同质内容。
- 确认页面至少有一条站内可爬到的内链,且锚文本能说明它的主题。
- 翻服务器日志,确认返回码正常,没有频繁超时或 5xx。
反复点击“请求编入索引”不会加快索引判断,它主要影响的是抓取环节。收不收,取决于页面本身值不值得留。
可以做和不必做的事
可以做的:补足页面独有的信息,把高度相近的页面合并,或者让各自的差异明确起来;给重要页面补内链;清理长期没有价值、也没人访问的页面,降低同质页面的比例。
不必做的:为凑数量批量生成页面;短时间内反复提交同一批 URL;把希望寄托在某次抓取之后状态自己变化。状态确实会变,但通常是被内容变化推动的。
观察周期建议按周看,不要按天。如果调整之后几周仍停在同一个状态,就回到内容本身:和已经收录的页面相比,它到底提供了什么别人没有的东西。