很多站点排查收录问题,第一反应是技术层面:robots 写错了、站点地图没提交、内链太少。这些确实会让 URL 根本不被发现,但还有一类情况更常见——蜘蛛来过,URL 也进了抓取队列,页面就是迟迟不进索引。这时问题往往不在“能不能抓”,而在“抓到了之后,这算不算一份有价值的页面”。
抓取和收录,解决的是两个不同的问题
抓取回答的是:这份内容能不能拿到。它更多看 URL 是否可达、robots 是否放行、服务器响应是否稳定。索引回答的是:这份内容放进结果集里有没有意义。后者要看页面是否独立成篇、有没有足够的可用信息、跟站内其他页面相比有没有存在的必要。
所以会出现这种状态:日志里蜘蛛访问正常,返回 200,后台显示“已抓取,尚未编入索引”,一挂就是几周。这不等于被拒绝,只是没通过质量门槛,或者还没排到处理队列里。
容易被判定为质量不足的几类页面
内容量太小,或者没有独立信息
几百字的页面不一定会被拒,但如果整页只复述了标题,或者是从别处搬来的通用描述,蜘蛛拿到的信息量跟一个空壳差不多。典型例子是商品页只有名称和价格、没有规格和说明;文章页只有一段导语加一堆推荐位。这类页面不是不能收,而是收了也提供不了额外价值。
同一批页面高度相似
分页、筛选结果、按标签聚合的列表页,内容主体往往是同一份模板,只有几行数据不同。站内相似度太高时,搜索引擎会挑代表性的一份留下,其余的选择不收。这不是惩罚,而是去重。真正需要关注的是:这些页面里有没有用户会直接搜到的独立内容。
主要信息依赖交互才出现
内容放在折叠面板里、要点开标签页才显示、列表靠滚动加载——对用户来说只是多点一下,对抓取程序来说可能整块都拿不到。如果页面的核心信息不在初始 HTML 里,蜘蛛看到的版本和用户看到的版本就不是一回事,判断质量时自然会吃亏。
页面本身可用性差
打开就弹窗遮住正文、移动端文字被挤成两行、正文里插满跳转链接——这些体验层面的问题不会直接导致不收录,但会作为整体质量的一部分被计入。尤其是弹窗和插屏,覆盖在正文之上的内容对抓取判断没有帮助。
自查时可以从这几个点入手
- 把页面源码里的正文单独提出来,看还剩多少有效字数;
- 用搜索框搜页面里的一句原话,看有没有大量同站相似结果;
- 关掉 JavaScript 再看一遍页面,确认核心信息还在不在;
- 对比同类型的几个页面,问一句:如果只留一个,留哪个。
该等一等,还是该动手改
刚上线几天到两三周的页面,状态停在“已抓取,尚未编入索引”属于正常范围,不需要马上动。可以先把精力放在持续产出新内容、把站内入口理顺上。
但如果一个页面挂了一个多月还没动静,并且同一批上线的其他页面都进了索引,那就说明这一份大概率是质量判断没过关。这时候补内容、补独立信息、把关键数据挪到初始 HTML 里,比反复提交 URL 更有效。改完不需要天天手动推送,正常的内链和站点地图会让蜘蛛再来一次。
收录是结果,不是操作。把页面做得值得被收,比反复催促蜘蛛更接近问题本身。
需要提醒的是,质量判断没有公开的分数线,也没有哪一步操作能保证页面一定进索引。能做的只是让页面在可抓取、可理解、有独立信息这几件事上尽量不出短板,剩下的交给时间。