站点规模变大之后,很多页面并不是一篇一篇写出来的,而是系统按规则自动生成的:标签列表、分类归档、作者页、日期归档、站内搜索结果页,以及各种筛选组合页。它们数量可观,有的甚至比正文页还多。这些页面要不要让搜索引擎收录,是收录管理里绕不开的一道题。
先分清它们和正文页的区别
自动聚合页本身不带原创信息,内容来自两处:一是其他页面的标题和摘要,二是生成规则。所以判断一个聚合页有没有收录价值,本质上是在判断它有没有提供正文页之外的东西,比如更完整的分类视角、更明确的主题边界、真实存在的用户需求。
站内搜索结果页:多数情况下留不住
站内搜索结果页的问题在于它是按查询生成的。同一批内容,换个关键词就是一个新 URL,组合数量几乎无限。这类页面通常有几个共同点:
- 内容完全来自已有页面,没有新增信息;
- URL 会随查询词大量繁殖,占用抓取资源;
- 用户从搜索结果进来看到的是一堆摘要,体验往往不如直接进正文。
对这类页面,比较常见的处理是给页面加 noindex。这里有个容易踩的坑:如果用 robots.txt 直接屏蔽抓取,爬虫就读不到页面上的 noindex,页面上写不写标签都没用。想让页面退出索引,优先用 noindex;想让爬虫别来抓,才用 robots.txt。
标签页和分类页:看边界是否清晰
标签页和分类页比站内搜索页更有价值,因为它们对应的是固定主题,而不是临时查询。判断时可以参考几点:
- 标签数量是否可控。一篇文章挂十几个标签,很容易生成大量只有一两篇内容的薄页面。
- 是否有独立的搜索需求。有人会直接搜这个主题词,页面就值得保留;只是内部归类用,价值就低。
- 页面上有没有补充信息。分类说明、编辑推荐、筛选后的差异说明,都算正文之外的内容。
如果发现一批标签页内容几乎相同,只差几篇文章,可以先考虑合并标签,或者对内容过少的那部分统一处理,而不是一上来就全部 noindex。
日期归档和作者页
日期归档对新闻类站点有意义,因为某年某月发生了什么本身就是需求;对更新不频繁的博客,按月归档往往只是索引邻居,价值有限。作者页则要看作者是否持续产出、页面有没有介绍内容。多人协作的站点里,一个只有一篇文章的作者页通常不值得专门收录。
处理时的几个操作建议
- 先看数据。在索引覆盖率报告和搜索表现里,找出这些聚合页实际被收录、被点击的情况,别凭感觉一刀切。
- 能合并的先合并。标签、分类重复的先做减法和归类,再决定是否 noindex。
- 区分不给收录和不给抓取。要退出索引用 noindex,要减少抓取压力用 robots.txt,两者别混着用。
- 内链要跟上。决定保留的聚合页,需要从导航或其他页面链过去,否则它既没有内容优势,也缺少被发现的机会。
聚合页的问题很少出在页面本身,更多是数量失控。先收紧生成规则,再处理已经存在的存量,通常比逐个页面调标签省事。
最后提醒一点:判断标准会随站点阶段变化。早期标签页少、内容集中,留着无妨;到了几千上万页的规模,同样的规则就可能变成负担。定期回看这些页面的收录和点击数据,比一次性定死规则更实际。