先看分类,再看总数
很多人打开索引报告,只看一个数字:已编入索引多少条。这个数字只告诉你结果,不告诉你原因。真正有用的是分类——哪些页面进了索引、哪些被排除、哪些还在排队。三类问题对应三套处理方式,混在一起看,只会越看越焦虑。
报告里的几个“桶”
不管界面怎么改,状态大体能归成三类:
- 已编入索引:页面已进入索引,可以被检索到。这里要留意的是,同一内容的其他网址可能被合并进来,所以数量比实际 URL 总数少一些,通常属于正常情况。
- 已抓取—尚未编入索引:爬虫来过、读过内容,但引擎暂时没把它放进索引。这是最值得关注的一类。
- 已发现—尚未抓取:URL 已经被知道,只是还没轮到抓取,多数情况下只是排队。
“已抓取—尚未编入索引”该看什么
先确认页面本身
- 内容是否和站内另一个页面高度重合,导致引擎只从里面选了一个
- 是否属于被模板撑起来的空壳页,只有标题、导航和少量说明
- 页面上是否有 noindex、canonical 或 meta 设置,把它指向了别处
- 页面是否依赖 JavaScript 渲染,而抓取时拿到的是一份空 HTML
再看站内结构
如果页面对用户价值有限,站内又几乎没有指向它的入口,那么它被留在索引外,其实是引擎在做取舍。这种情况下继续提交 URL、加外部链接,效果往往不会太明显,优先要解决的是页面本身值不值得留。
“已发现—尚未抓取”多半是耐心问题
这个状态说明 URL 已经进入队列,只是还没安排抓取。站内入口少的页面,排队时间会更长。可以检查几件事:sitemap 里有没有列它、相关页面是否有指向它的内链、它是不是新发布的页面。如果答案都正常,就按抓取周期等待,不必每天反复提交同一个地址。
“已排除”里最需要分清的两类
主动排除
- noindex:如果是自己加的,确认是否符合当初的意图,尤其是测试后忘了删的情况
- robots.txt 屏蔽:要注意被屏蔽抓取的页面仍有可能出现在索引里,只是没有摘要,屏蔽抓取和退出索引是两件事
- canonical 指向其他 URL:确认指向是否正确,指错了会连带影响本来该出现的那个页面
系统排除
- 重复内容,未选为标准网页
- 软 404:内容过薄,或与页面想承接的意图不符
- 已被抓取但判定为低价值,暂时不索引
一个可执行的排查顺序
- 先在被排除的名单里,找出你确实希望被收录的页面
- 逐个检查页面上的 noindex、canonical 与 robots 设置
- 检查这些页面在站内有没有真实的入口链接,而不只是躺在 sitemap 里
- 判断内容和已有页面是否重复,决定合并、改写还是保留
- 调整完成后,等待一个抓取周期,再观察状态是否变化
- 记录每次改动的时间点,避免同一批 URL 被反复折腾
别把报告当成唯一依据
报告本身有滞后,样本也会受分组方式影响,不同站点看到的分类粒度并不完全一致。判断某个页面到底有没有被索引,可以结合站内搜索、直接查询 URL 状态等方式交叉验证。报告真正的价值,是告诉你“哪一类页面在系统眼里处于什么状态”,而不是精确到每一条记录。
索引报告是一张分类地图,不是一个分数。看它的时候,应该问“为什么这一类被留下、那一类被排除”,而不是“怎么让总数变得更大”。