排查收录问题时,很多人的第一反应是查蜘蛛有没有来、sitemap 有没有提交。抓取通道确认无误之后,剩下的问题往往就落到页面本身:同样的抓取频次,为什么有的页面进了索引,有的却一直停在门外。这篇文章把“页面质量”拆成四个可以自己动手查的维度,帮你在改代码之前先把方向定下来。
一、先分清抓取与收录:蜘蛛来过只是入场券
抓取是搜索引擎拿到页面内容的过程,收录是它判断这个页面值得放进索引、并准备好对外展示的过程。两者之间那道门槛,主要看页面能不能提供独立、可解释、对用户有用的信息。所以当日志显示蜘蛛频繁访问却迟迟不进索引时,通常不是抓取问题,而是页面本身让搜索引擎判断它不值得单独占一个位置。
二、维度一:正文占比是否过低
把源码里的导航、侧栏、推荐位、评论、页脚都划掉,剩下的正文还剩多少,这是最直观的判断方式。如果一个页面正文只有两三行,其余全是模板和推荐,它在质量维度上就很吃亏。常见的几类:
- 列表页、标签页、筛选页的正文稀薄
- 空结果页、无内容占位页
- 只有一张图或一段视频,没有任何文字说明
处理方式不是把所有模板都删掉,而是判断这个页面有没有独立价值。没有的话,考虑合并、设置 noindex,或者让它在站内被合理收敛。
三、维度二:内容是否唯一
重复内容不会直接导致站点被处罚,但它会让搜索引擎在多个相似 URL 里只挑一个,其余的自然进不了索引。常见的有三种:
- 完全重复:同一份内容复制到不同 URL,比如带参数和不带参数的版本
- 近似重复:标题不同但正文高度雷同,多出现在批量生成的页面
- 聚合重复:聚合页把详情页内容整段搬过来,没有自己的整理和判断
前两种靠 canonical、URL 规范化和参数处理收敛;第三种要先问自己:这个聚合页除了搬运,还提供了什么。如果答案是否定的,它被排除在索引外就是正常结果,不必强行对抗。
四、维度三:URL 是否能被稳定识别
URL 规范看似是技术细节,实际会影响收录判断。大小写混用、末尾斜杠两种写法并存、index.html 与目录地址同时可访问,都会让同一个页面出现多个入口。搜索引擎需要花时间判断它们是不是同一个页面,这个过程本身就会拖慢收录。
比较稳的做法是:站内链接统一写成一种形式,其余形式做 301 跳转,canonical 指向最终地址,并且不要指向 404、noindex 或跳转链上的地址。
五、维度四:页面能不能自证价值
最后一层是内部和外部的信号。一个刚上线、没人链接、内链也进不去的页面,搜索引擎缺少判断依据,收录自然慢。可以从这几处补:
- 从相关栏目页、详情页加内链
- 相关页面之间互相引用
- 有真实分享或外部引用时,页面更容易被识别
这里说的是提高被发现的概率、补充判断依据,而不是保证收录。
如果一个页面在内容、唯一性、URL、内链这四个维度上都站得住,收录慢通常只是时间问题;如果其中两三个维度都有明显短板,反复提交 sitemap 也很难改变结果。
六、动手前的自查顺序
- 先从日志确认蜘蛛是否来过,排除抓取层面问题
- 检查该页正文占比,判断是不是空壳页
- 在站内搜一段正文,看有没有近似重复的页面
- 检查 URL 变体是否已收敛到唯一地址
- 检查有无内链入口,页面能否从首页几跳内到达
- 最后再决定是优化、合并,还是直接收口
收录问题很少由单一原因造成。按这个顺序走一遍,多数情况下能在动手改之前先把方向定下来,避免在抓取通道上反复折腾,却始终没碰到真正的问题。