很多站点在做收录优化时,会把注意力放在文章详情页,但真正让索引变乱的,往往是标签页、聚合页、列表页这些顺带生成的页面。它们天生数量多、更新频繁、内容重复度不低,如果处理方式不统一,容易出现两种极端:要么大量低质页面进入索引,稀释站点质量;要么把有价值的入口页全部封掉,内页发现速度反而变慢。
先给页面分角色:入口型还是内容型
判断一个页面该不该收录,第一步不是看它有没有排名,而是看它承担什么角色。
- 内容型页面:本身提供完整信息,用户点进来就能解决问题,比如文章详情页、产品详情页、专题深度页。
- 入口型页面:主要作用是串联链接,帮助用户和蜘蛛找到更多内容,比如分类列表、标签聚合、作者页、时间归档。
- 混合型页面:既有一定内容摘要,又承担导航作用,比如带简介的专题聚合页、有总结的榜单页。
入口型页面不等于没有价值,但它的价值更多体现在发现和分发,而不是独立满足搜索需求。如果它只是把已有内容按不同维度重新排列一遍,且没有额外说明、筛选逻辑或编辑整理,那么收录后与详情页竞争同一批关键词,反而会带来重复内容问题。
哪些标签页和聚合页可以考虑放行
不是所有聚合页都该被排除。满足下面几个条件时,可以考虑让它们进入索引:
- 页面有稳定的主题边界,比如某个明确品类的全部产品,而不是所有带某个词的文章。
- 页面上有编辑补充的说明、筛选说明或推荐理由,不是纯链接堆叠。
- 该页面能承接用户主动搜索的需求,比如合集、对比、入门清单这类查询。
- 页面数量可控,不会因为标签组合、参数筛选无限膨胀。
- 即使不收录,也不会影响重要内页的发现路径。
如果聚合页只是站内导航的辅助,且内页已经通过其他路径被稳定抓取,那么让它保持可抓取但不进入索引,通常更干净。这里要区分抓取和收录:允许蜘蛛抓取,是为了让它顺着链接发现内页;不进入索引,是避免低价值页面占用索引名额。
需要收敛时,先选对工具
常见的处理方式有三种,效果和适用场景并不一样。
1. noindex 配合可抓取
如果希望蜘蛛继续访问页面、跟随链接,但不希望页面出现在搜索结果里,可以在页面 head 中设置 noindex。注意不要同时用 robots.txt 禁止抓取,否则蜘蛛看不到 noindex,页面仍可能被索引。
2. canonical 指向主版本
当多个标签页或筛选页内容高度相似,只是排序、参数或展示维度不同,可以用 canonical 指向一个主版本。前提是主版本确实存在,并且内容覆盖更完整。不要把 canonical 当成随便指一个页面的万能工具,指向不相关页面会造成信号混乱。
3. robots.txt 或链接层收敛
对于参数组合无限生成、没有独立价值的页面,可以从内链中移除入口,或通过 robots.txt 限制抓取。但要注意,robots.txt 只是控制抓取,不保证页面不被索引;如果页面已经被外部链接指向,仍可能以 URL 形式出现在索引中。更稳妥的做法是:先减少站内入口,再配合 noindex,最后才考虑 robots.txt。
处理时容易踩的坑
- 一刀切封掉所有标签页:如果内页发现主要依赖标签聚合,封掉后新内容可能长时间不被发现。
- noindex 和 canonical 同时指向不同 URL:信号互相矛盾,蜘蛛可能忽略两者。
- 只改模板,不清理旧页面:已收录的聚合页需要等待重新抓取才会更新状态,期间可能继续出现在索引里。
- 用 robots.txt 屏蔽后不再检查:被屏蔽的页面仍可能因外链被索引,需要配合移除或 noindex 处理。
- 把收录量当成唯一指标:收录数量上升不代表有效流量上升,重点应看重要页面是否稳定进入索引并参与展示。
收录策略的目标不是让索引里页面越多越好,而是让该出现的页面稳定出现,不该出现的页面尽量不干扰。
一个可执行的检查顺序
- 列出站点所有自动生成的标签页、聚合页和列表页,按 URL 模式归类。
- 标记每类页面的角色:入口型、内容型还是混合型。
- 检查它们是否有独立内容、稳定搜索需求和可控数量。
- 对需要保留的页面,补充说明文字、优化标题和摘要,让页面有独立价值。
- 对需要收敛的页面,优先从内链和 sitemap 中移除,再按情况使用 canonical 或 noindex。
- 处理完成后,用同一批 URL 持续观察抓取和索引状态,不要只看一天的数据。
标签页和聚合页不是天生该被排除,也不是天然该被收录。先判断它到底是入口还是内容,再决定放行、收敛还是移除,索引结构会清楚很多。