排查收录时,很多人把注意力全部放在“爬虫有没有来”上。但抓取和收录之间还有一道判断:这个页面值不值得占用索引空间。蜘蛛把 HTML 拿回去之后,引擎会先做一轮内容质量评估,评估不达标的 URL 可能长期停在“已发现”状态——日志里能看到抓取,索引里却没有它。
维度一:主体内容占比
把页面上不属于正文的部分圈出来——导航、侧栏推荐、页脚链接、广告位、弹窗、版权信息——剩下的部分才是主体。如果主体内容只占整页 HTML 的一小部分,页面在质量判断上就会吃亏。常见的情况是:一段两百字的介绍,被塞进十几个模块拼成的模板里,视觉上热闹,实际信息量很低。
维度二:模板化重复
分类页、聚合页、标签页最容易踩这条。同一套模板批量生成几千个 URL,每个页面只有标题和几行摘要不同,其余完全一致。这类页面单看没问题,放在一起看就是大量近重复内容。处理方式不是全部删掉,而是做区分:有独立筛选价值、有真实搜索需求的留下;纯拼接、无差异的收拢合并或设为不可索引。
维度三:页面是否兑现了标题的承诺
标题写着“办理流程”,正文却在讲公司简介;标题写“价格表”,页面只有一句“详情请咨询”。这种错位会让页面被判为不满足需求。判断方法很朴素:只看标题和首屏,问自己“用户点进来想解决的问题,第一屏能不能看到答案的开头”。
维度四:技术层面的可用性
- 首屏依赖 JS 渲染,而渲染所需资源又被 robots.txt 挡住;
- 移动端排版错位,正文被浮层或吸底广告遮住;
- 服务器响应经常超时,抓取中途放弃,内容只取到一半;
- 主体文字写在图片里,文字层为空。
这几条本身属于抓取与渲染问题,但结果会体现在质量判断上:引擎拿不到完整内容,自然无法给出正面评价。
维度五:内容是否有维护痕迹
长期不更新不是原罪,但页面信息过期、站内链接大面积失效、联系电话已停用,会直接拉低可信度。反过来,有明确更新时间、有修订说明、正文中引用的信息仍然准确的页面,在同类内容里更容易被保留下来。
质量判断没有公开的分数线,也不存在“做到这几点就保证收录”的公式。上面这些是提高通过率的常见方向,不是通行证。
未收录页面的自查顺序
- 随机抽 10 个未收录 URL,逐个估算主体内容占比;
- 把这些 URL 放在一起比较,看是否只是标题和几行摘要不同;
- 用渲染后的 HTML(不是源码)确认正文可读、无遮挡;
- 核对标题与首屏内容是否一致,是否存在答非所问;
- 检查最后更新时间与站内失链情况;
- 根据结果决定是补内容、合并页面,还是调整索引放开的范围。
整体排查顺序通常是:先确认可抓取,再确认可索引,最后才轮到质量。前两关没过,谈质量没有意义;前两关都过了却长期不进索引,就该回到上面这几条逐项对照,而不是继续往提交入口里堆 URL。