网站收录

标签页和聚合页要不要进索引:先按三类页面分开看

站点里的标签页、分类页和筛选页数量常常远超原创内容,处理方式却经常一刀切。这篇文章把聚合类页面分成三类,给出可以观察的判断信号,以及保留补内容、合并同类、限制收录、直接挡掉四种处理办法,并提醒 noindex、内链和 canonical 之间容易互相打架的地方。

网站收录

标签页和聚合页要不要进索引:先按三类页面分开看

很多站点里,分类页、标签页、聚合页的数量远超原创内容本身。这些页面本身不算错,但质量差别很大:有的是用户真正会点的导航入口,有的只是把标题排成一列的空壳。把它们统统交给搜索引擎,结果往往是索引里塞满低质页面,真正重要的内容反而被稀释。

第一步:先把三类页面分开看

  • 导航型聚合页:分类页、专题页、系列文章目录。有人手动维护,点进去能找到下一步。
  • 自动型聚合页:标签页、作者页、日期归档。由系统自动生成,数量随文章增加而膨胀。
  • 结果型页面:站内搜索页、筛选与排序页、组合条件页。参数一多,数量可以接近无限。

三类的处理思路并不一样。导航型页面通常值得留在索引里,前提是有实际内容支撑;自动型要看是否有独立价值;结果型页面绝大多数情况下不适合让蜘蛛大量抓取。

判断一个聚合页值不值得收录

不用太玄学,几个可以观察的信号:

  1. 有没有独立的标题和描述。如果标签页只是把文章标题排成一列,页面标题还是系统默认的“标签:XXX”,它能表达的信息就很有限。
  2. 页面内容是不是别处已经有了。分类页如果只展示标题和摘要,和文章列表页高度重合,价值就偏低。
  3. 它有没有被链接、被点击。内链入口没几个、服务器日志里几乎没人访问的聚合页,通常也没必要强推进索引。
  4. 数量会不会失控。几百个标签页还看得过来,几万个基本没法逐个监控,数量本身就是风险。

分档处理:四种做法

保留并补内容

核心分类页、专题页值得投入:加一段人工撰写的导语、补充筛选说明、把最相关的几条内容放到前排。这样页面才不只是一个列表。

合并同类

同义标签、近义分类(比如“SEO”和“搜索引擎优化”)应该合并成一个,而不是靠指向同一个地址硬凑。合并之后把旧地址 301 到保留的那个,入口统一,也少一堆重复。

限制而不是一刀切

如果标签页确实有一部分价值,可以只放开内容量足够的那部分,其余用 noindex 挡在索引外。noindex 只影响进索引,蜘蛛仍然可以抓取,便于顺着链接发现别的页面。注意别用 robots.txt 屏蔽这些路径,否则蜘蛛读不到 noindex 指令。

直接挡掉

站内搜索结果页、多条件筛选页,建议从抓取入口上就断开:不进 sitemap、站内不要大量导链、必要时对参数做统一处理。如果已经大量被收录,先看它们是怎么被抓到的,再逐步收回。

一个常见的误解是:以为 noindex 加上就完事了。指令生效需要蜘蛛重新抓取那个页面,在这之前,旧记录仍会留在索引里。

几个容易踩的坑

  • 把 robots.txt 当成收录开关,写完才发现 noindex 根本没被读到。
  • 给标签页加了 noindex,却仍在导航、侧栏里大量链接它们,等于白占抓取资源。
  • 用 canonical 指向一个本身也不该被收录的页面,问题只是换了个地方存在。
  • 聚合页内容半年没更新,系统还在持续生成新的子页面。

还有一个容易被忽略的细节:内链资源最好留给真正想推的页面。如果大量链接都指向被挡住的聚合页,蜘蛛顺着爬过去也拿不到有用的东西,反而分散了对核心内容的注意力。

最后,聚合页的收录状态不是一次决定就完事。内容在增加、标签在变化,隔一段时间去 GSC 的“已编入索引”和“已排除”报告里对一遍,看看有没有新的批量生成页面冒出来。收录这件事,本质上是持续做取舍,而不是设一次开关。