两个状态,卡点完全不同
在站点后台的页面报告中,「已发现 - 尚未编入索引」和「已抓取 - 尚未编入索引」经常被放在一起看,甚至被当成同一件事。但它们的含义差别很大:
- 已发现但未编入索引:搜索引擎知道这个 URL 存在,通常来自内链、sitemap 或外部链接,但还没有真正来抓,或者只抓了一部分。问题出在抓取环节。
- 已抓取但未编入索引:页面已经被抓取过,内容也拿到了,但经过处理后没有被放进索引。问题出在处理与选择环节。
分不清这两者,排查方向很容易跑偏:明明是抓取没排上队,却反复去改正文;明明是内容重复导致没被采用,却一直加内链。
卡在「已发现」:先解决抓取能不能发生
这一层的核心问题是蜘蛛还没来,或者来得太少。按下面的顺序看:
- 服务器与响应:是否有大量超时、5xx、连接被拒。抓取资源被错误页消耗,正常页面自然排不上。
- robots.txt 与抓取限制:是否误拦了路径,或抓取频次被压得很低。
- 内链入口数量:只有一两个入口、还埋在深层列表里的 URL,被发现和被安排的优先级通常更低。
- sitemap 质量:地址是否可访问、是否混入重定向和错误页、是否长期不更新。
- 站点整体抓取额度:大量低价值 URL 长期占用额度时,新页面会更晚被安排。
这一层修好后,状态往往会先变成「已抓取」,然后再进入下一步的判断。
卡在「已抓取」:问题在页面本身
已经被抓过却进不了索引,说明抓取这一步没障碍,需要看页面是否值得被保留。常见原因:
- 内容偏薄或缺少独立信息:同一模板下大量页面只换了标题和几个字段。
- 与站内其他页面高度相似:需要先选出代表页,其余页面考虑合并、加 noindex 或调整定位。
- 规范地址不清晰或被指向别处:canonical 指到了一个自己也没有进索引的地址。
- 正文靠脚本渲染:抓到的 HTML 里没有实质内容。
- 状态与内容不一致:返回 200,页面却写着已下架、已结束。
- 页面类型本身不适合索引:筛选结果、排序参数、分页尾页等。
先分组,再决定改什么
不要拿全站收录率直接下结论。按模板把 URL 分成几组,比如文章页、商品页、标签页、筛选页、分页,分别算每组里两个状态各占多少。常见的局面是:整体收录率不高,但文章页其实正常,拖后腿的是筛选页和标签页。这种情况下,调模板比改正文更有效。
处理顺序上的一个原则
先解决「已发现」,再看「已抓取」。抓取都没发生的时候,讨论内容质量意义不大,因为搜索引擎还没看过这些页面。反过来,如果大量页面已经抓取过却迟迟不进索引,继续加内链、提抓取频次,通常也不会有明显变化。
抓取、处理、索引是三个环节,任何一环停下,都会在报告里表现为「没收录」,但原因并不相同。修复动作要对应到真正卡住的那一环。
建议做一个简单的状态表
按周记录:每个模板分组的 URL 总数、已发现数、已抓取未索引数、已索引数,以及当周做过的改动。几周下来就能看出,某个动作之后是哪一层状态在移动。这比反复猜原因要可靠,也能避免在收录没有立刻变化时,过早否定一个本来正确的调整。