内容站运营一段时间后,地址数量往往会明显超过文章数量。多出来的部分,大多是系统按规则自动生成的聚合页:标签页、作者页、日期归档、分类的多层筛选结果。它们不是编辑一个个建出来的,而是跟着内容属性一起长出来的。收录报告里出现大量这类地址时,需要先判断它们是资产还是负担。
这些页面是怎么长出来的
一篇内容通常带多个属性:所属分类、若干标签、作者、发布时间。CMS 默认会为每个属性各生成一个列表页,再加上分页,一个属性就可能衍生出十几个地址。如果还支持按时间、按热度排序,同一批内容能组合出更多入口。这些页面在站内是导航效率的产物,对外却是搜索引擎眼中的一批新地址,需要单独评估。
聚合页的正当价值
- 给用户一条按主题浏览的路径,比只靠搜索框更顺
- 把链接集中指向同一主题下的文章,帮助深层页面被发现
- 承接一些宽泛的主题词浏览需求,不必为每个词单独做页面
问题不在聚合页本身,而在于数量。当标签页的数量是文章数量的好几倍,且多数标签下只挂着一两篇文章时,这批页面的整体价值就会下降。
判断一个聚合页值不值得收录
- 内容量:列表里只有一两条内容时,页面主体几乎为空,可替换性很高
- 相关性:标签组合是否自然,还是系统硬凑出来的交集
- 检索需求:这个主题是否真的有人会主动搜索,还是只对内部导航有意义
- 是否重复:和分类页、首页推荐位呈现的内容是否高度重合
- 是否有替代入口:如果分类页已经覆盖同样的内容集合,标签页就是多余的
判断时不要只看单个页面的字数,而要看这个页面对用户是否提供了别的页面没有的信息顺序。
几种常见处理方式
保留并优化
对确有检索需求、内容量充足的主题聚合页,可以正常保留,补充一段说明文字、控制每页条目数量、把分页处理好。这类页面有资格作为独立入口存在。
收敛到主集合
如果标签页和分类页内容几乎一致,可以用 canonical 指向主集合页,让引擎知道哪一份是主版本。注意 canonical 是建议而非强制,站点自身的内链也应指向主版本,否则信号会互相冲突。
用 noindex 排除
对内容单薄、只对站内导航有意义的聚合页,可以加 noindex。它和 robots.txt 屏蔽是两件事:
noindex 表达的是“可以抓,但别放进索引”;robots.txt 屏蔽的是抓取行为本身。用屏蔽来解决收录问题,往往连页面内容都读不到,标记也无法生效。
从源头减少生成
如果某个标签只有一两篇文章,干脆不生成列表页,或设置最小条目阈值再生成。这比事后批量加标记更省事,也避免了内链里出现大量空壳入口。
和站点地图、内链的配合
站点地图里不必把所有聚合页都列上,只保留希望被发现的那些。内链方面,全站铺开的标签云会把链接分散到大量低价值地址上,建议只展示内容较多的标签,其余收进折叠区或干脆不展示。已加 noindex 的页面,同样不适合继续放在全站导航里。
一个可执行的自查顺序
- 从收录报告或日志中导出聚合类地址,按类型分组(标签、作者、日期、筛选)
- 统计每组页面的平均内容条目数,筛出条目极少的
- 对照站内导航,确认这些页面是否真的有用户使用路径
- 先对最少的一批做 noindex 或收敛,保留其余部分
- 观察一段时间内抓取分布和收录变化,再决定是否扩大处理范围
处理时尽量避免一次性把全部聚合页排除。它们同时承担着内容发现和内链中转的作用,全砍掉可能让深层文章的入口变少。分批调整、观察反馈,比一次性动作更容易看清影响来自哪里。