做收录排查时经常会碰到这种情况:整站收录比例看着还行,但拆到频道一级就发现差距很大——有的目录几乎全进索引,有的目录几个月过去还停在“已发现”。同一个域名、同一套服务器,差异往往不在服务端,而在站内结构和页面本身。
第一步:按目录拆数据,别看整站平均值
整站收录率是个平均数,它会把频道之间的落差抹平。开始找原因之前,先把手上的数据切成几块:
- sitemap 按目录或频道拆分提交,这样提交量和索引量可以一对一对地比,而不是只看到一个总数。
- 抓取日志按路径前缀统计,看每个目录被请求的次数、状态码分布、平均响应时间。抓得少和抓了不收录是两回事。
- 抽样检查索引状态,每个频道抽几十条 URL 看状态,比只盯着索引总量更有参考价值。
拆完之后常见的结论是:某几个频道的抓取量本身就很低,问题出在发现环节,而不是评估环节。
差异通常来自这几处
入口深度与内链倾斜
首页和主导航指向的目录,入口浅、内链多,被发现和重抓都更快。藏在三级菜单后面、只在列表页第 3 页之后出现的地址,可能长期只有一个入口。这不是蜘蛛“偏心”,而是站内链接权重的自然结果。检查一下:频道首页是否在主导航里、列表页是否分页合理、详情页之间有没有相关推荐或上一篇下一篇这类横向链接。
模板与渲染方式
同一站点的不同频道,可能用了不同的前端模板。有的频道内容随 HTML 直出,有的频道需要 JS 请求接口才能拿到正文。对后者来说,首屏 HTML 里可能只有壳,蜘蛛拿到的内容明显更薄,处理节奏也会不一样。对比两个频道抓取后的 HTML 快照,很容易看出差别。
内容重复度
有些频道天然重复度高,比如商品的不同规格页、文章的多个来源转载、按标签聚合出的列表。重复度高的目录里,大量 URL 会被规范化到少数几个版本上,剩下的自然不进索引。这类情况不是故障,需要判断的是:这些页面有没有必要单独存在。
URL 结构与参数
带筛选参数、排序参数、会话参数的频道,地址数量会成倍膨胀,抓取被分散到大量近似地址上。可以对比两个频道的 URL 模式,看看是否一个干净、一个参差不齐。参数多的频道通常需要额外的规范化处理。
可以按这个顺序调整
- 先补内链:让目标频道出现在主导航、面包屑和相关的横向模块里,这是改动成本最低的一步。
- 再看模板:确认正文在初始 HTML 中可见,重要内容不依赖二次请求。
- 按频道拆分 sitemap,只放需要被索引的规范 URL,便于后续观察提交与索引的对应关系。
- 处理重复与参数:确定每个内容的主版本,其余版本用 canonical 或跳转合并。
- 留出观察周期,按周对比日志中的抓取分布,而不是每天看一次。
收录比例不是越高越好。为了拉高某个频道的收录数去批量生成低信息量页面,短期数字会动,长期反而拖累整站被抓取和评估的效率。
频道之间的收录差异,多数时候是结构问题的外化表现。把数据拆细、把发现路径理顺,剩下的交给时间就够了。