用 site: 查收录量,得到的通常只是一个总数。总数涨跌背后,真正的问题往往藏在目录结构里:栏目页大面积不入索引,详情页却收录正常;或者新上线的目录几乎零收录,老目录却一直增长。把收录比例按目录拆开看,比盯着一个总数更容易定位原因。
为什么按目录拆比看总数有用
同一个站点的不同目录,模板、内容厚度、内链位置、更新频率都可能完全不同。混在一起统计,问题目录的异常会被其他目录的数字掩盖。按一级或二级目录分组,可以直观看到每个目录的收录情况大概处在什么水平。
这里说的比例不需要精确到个位,抽样估算就足够支撑判断。重点不是算出一个数字,而是找出明显低于同站其他目录的那一组。
抽样怎么抽
- 每个一级目录抽 20 到 50 个 URL,尽量覆盖列表页、详情页和分页
- 用 site: 加目录前缀做粗略查询,结果只作参考,不作为精确值
- 对照抓取日志或抓取统计,确认这些 URL 是否被抓过、抓了几次
- 对照 Sitemap,确认这些 URL 是否出现在提交列表里
四组数据放在一起,基本能区分出“没被抓”“抓了没收”“收了被替换”这几种情况。
三类最常见的目录失衡
栏目页大量未收录
列表页内容靠标题堆叠,正文信息少,同一栏目的多个分页又高度相似。这类页面对搜索引擎来说价值偏低,即使被抓取,也往往只入索引一小部分。可以先检查分页是否重复、是否带大量排序参数,以及列表里有没有足够的差异化说明文字。
详情页收录正常,栏目页几乎不收
常见原因是详情页被内链大量指向,而栏目页只出现在导航或面包屑,入口单一。另一个原因是栏目页本身没有独立内容,只是详情页的集合,搜索引擎更倾向于直接收录详情页。若栏目页确实没有独立价值,收敛一部分比强行让它收录更合理。
新目录几乎零收录,老目录持续增长
先确认新目录有没有被抓取过。如果抓取记录都很少,问题多半在发现路径:内链入口太少、层级太深、Sitemap 没更新。如果抓取了却没收录,则更可能是内容质量或与其他目录重复度偏高。
建议的排查顺序
- 确认目录没有被 robots.txt 或页面级 robots 指令拦截
- 看抓取记录:有没有抓、抓取频次是否明显低于其他目录
- 看内容:是否与其他目录模板高度重复,是否只是列表堆叠
- 看内链:从首页到该目录下页面的点击距离是几层,入口有几个
- 看 canonical 与 URL 规范:是否出现同一内容多个地址互指的情况
- 看 Sitemap:目录下的 URL 是否被完整提交,是否混入了不该提交的参数页
这个顺序的原则是:先排除“被明确拦掉”,再排除“没被发现”,最后才讨论内容值不值得收录。顺序反过来做,很容易在内容上反复修改却看不到变化。
拆开之后可以做的几件事
- 补入口:给收录差的目录增加合理的内链位置,而不是在全站页脚堆链接
- 做收敛:没有独立价值的筛选页、分页、空列表,用规范方式归并或限制提交
- 补内容:栏目页加一段说明或选取规则,让它和纯列表区分开
- 分清优先级:在同一次抓取预算下,先保证重点目录的详情页和核心栏目页
收录比例是诊断工具,不是目标。为了把某个目录的比例做上去而强行提交大量低价值 URL,通常只会让整体抓取效率更差。
多久看一次结果
调整内链或收敛 URL 之后,抓取和索引的反馈通常需要数周才趋于稳定。建议按周记录各目录的抽样比例,观察趋势而不是单日数字。如果连续几周没有变化,再回到抓取记录,确认调整是否真的改变了抓取分布,而不是继续在内容上反复改。