遇到收录不理想的情况时,很多人的第一反应是“蜘蛛是不是没来”。但看服务器日志会发现,抓取请求并不少。问题往往在于:蜘蛛来了,页面却没给出足够的理由被放进索引。抓取是访问行为,收录是评估结果,两件事不能混为一谈。
与其等收录数据出问题再回头翻查,不如在页面发布前后先自己过一遍。下面这份清单按四个角度排列,顺序可以按实际情况调整。
一、主体内容是否真的可读
搜索引擎需要先从 HTML 里判断这个页面在讲什么。如果主要内容全靠脚本渲染,或者正文被折叠、被图片替代、被弹窗遮挡,判断成本就会变高。
- 关掉脚本之后,页面是否还能看到核心文字。
- 正文是否和标题、面包屑、页面描述对得上,而不是标题党。
- 是否有大段与主题无关的推荐位、广告位挤占了主体区域。
- 内容体量是否和页面想承担的角色匹配,单薄页面很难撑起一个独立地址。
二、是否存在重复或近似重复
重复内容本身不一定带来惩罚,但它会让蜘蛛在多个相似地址之间做选择,结果可能是其中一个被收录,另一个长期停留在“已发现”状态。
- 列表翻页、筛选参数、排序参数是否生成了大量内容相近的地址。
- 同一篇内容是否同时存在于栏目页、聚合页、打印页、移动版地址。
- 站内搜索结果的地址是否被开放抓取。
- 模板里的空白栏目、无结果的筛选组合是否也会生成页面。
处理思路上,先判断这些页面有没有独立的检索价值。没有的话,用 canonical 指明主版本,或者直接限制抓取,都比放任积累更清晰。
三、URL 与链接是否规范
URL 层面的混乱常常是收录问题的放大器。同一个页面出现大小写、末尾斜杠、跟踪参数等多种写法时,链接信号和抓取配额都会被摊薄。
- 站内链接是否统一指向同一个版本,包括导航、面包屑和正文内链。
- canonical 指向的地址是否可访问、是否返回正常状态码。
- 站点地图里的地址是否都是可索引的最终地址。
- 分页页、筛选页是否有明确的自我规范策略。
四、有没有技术层面的硬阻碍
这一类问题最直接,排查起来也最快,但很容易被忽略。
- 目标页面是否被 robots.txt 屏蔽,或者被误加了 noindex。
- 返回状态码是否稳定,有没有出现软 404、跳转链过长。
- 服务器响应时间是否稳定,是否存在大批量超时。
- 重要页面是否离首页太远,只能靠站点地图被发现。
建议的排查顺序
- 先随机抽查若干页面,确认返回正常状态码、内容可读。
- 再检查该地址是否被 robots.txt 或 meta 标签限制索引。
- 然后对比站内是否存在内容相近的其他地址,决定是否合并。
- 最后统一内链与站点地图里的地址写法。
收录不是提交动作的结果,而是页面本身、链接结构和技术状态共同作用的结果。自检的意义在于,把能自己确认的部分先确认掉,剩下的再交给时间。