很多站点的收录量里,真正的内容页只占一部分,剩下的大头是自动生成的列表页:分页、筛选结果、标签页、时间归档。这类页面该不该被收录,没有统一答案,但有一个可以落地的判断顺序。处理得好,它们能带流量也能帮蜘蛛发现内容;处理不好,它们会稀释站内权重,还会产生大量近似重复的 URL。
先把自动生成的页面分成三类
这三类的生成逻辑和风险点不同,混在一起处理容易做出错误决定。
- 分页:把同一列表拆成 ?page=2 或 /list/2 这样的多页。它和第一页是同一主题的延续,本身不产生新主题。
- 筛选与排序:由参数生成,比如颜色、价格区间、排序方式。组合数量可能爆炸,且大量组合的内容完全相同。
- 归档与标签:按时间、作者、分类、标签聚合。有的标签是真实的主题入口,有的只是零散页面的堆积。
判断标准:它能不能独立满足一个搜索意图
与其纠结技术细节,不如先问一句:用户会不会专门搜这个词,并且落地到这个页面?
- “耳机”这个分类页可能有搜索需求,“耳机 黑色 200-300 元 按销量排序”通常没有。
- 标签“降噪耳机”可能有需求,标签“2024”大概率没有。
- 分页第 2 页基本没有独立搜索意图,但它是蜘蛛继续爬向更早内容的路径。
有独立意图的保留并优化,没有的把抓取资源集中在有意图的页面上。这个判断不依赖工具,靠对业务的理解就能做。
分页:保留可抓取路径,不要一刀切 noindex
常见做法是把所有分页都设成 noindex,只留第一页。这能减少近似重复,但副作用是列表深处的内容失去了主要入口;如果内链又只做“下一页”,蜘蛛可能很难爬到后面。
更稳妥的处理:
- 每一页做自引用 canonical,不要把第 2 页指回第 1 页,那等于告诉搜索引擎后面几页都是重复内容。
- 分页链接用可抓取的普通链接,不要依赖点击后异步加载;如果必须异步,至少保留 href。
- 给分页加上可读的标题和必要的说明,避免所有页的标题完全相同。
- 条目太少、内容几乎没有的分页(比如最后一页只有一条),可以考虑合并或直接不生成。
next 与 prev 这类关系标记现在不再是索引信号,保留无害,但不要指望它解决收录问题。
筛选与排序:按组合价值分流
筛选页的关键是控制组合数量。可以按这个顺序处理:
- 有搜索量、内容有差异的组合,允许收录,并给独立的标题与说明文案。
- 纯排序参数(sort、order)通常不值得单独索引,用 canonical 指向默认排序,或在 robots 中屏蔽抓取。
- 追踪参数(utm、gclid、ref)一律不参与索引判断,最好在服务端或 canonical 里去掉。
- 多条件叠加后结果过少或为空时,返回合适的空状态,不要返回 200 的空页面。
需要提醒的是,用 robots.txt 屏蔽参数页,会让搜索引擎看不到页面上的 canonical 提示,两种手段选其一即可,不要指望屏蔽之后还能靠 canonical 传递信号。
归档与标签:薄聚合页可以合并
标签页和归档页的价值差别很大。判断方式很简单:这个聚合下有多少条内容,内容之间是否围绕同一主题。
- 内容充足、主题集中的标签页,可以当作正式入口来运营,写一段导语,加上内链。
- 只有一两条内容的标签页,考虑合并到上级分类,或设置 noindex 并从内链中移除。
- 按日期、作者、月份生成的归档页,如果没有搜索需求,可以只作为爬取入口保留,不做索引。
动手前的检查顺序
- 先统计所有自动生成页面的数量,估算它在总 URL 里的占比。
- 按上面三类分别标记:保留索引、保留抓取但不索引、不生成或不抓取。
- 检查 canonical 是否正确自引用,参数是否被规整。
- 检查列表页的内链是否真的能走到更深的内容页。
- 改动后观察索引报告和日志,确认被移出的确实是列表页,而不是把该收的内容页一起清掉了。
列表页不是收录的敌人,失控的列表页才是。给每一类页面一个明确的角色,比统一 noindex 或统一放开都更有效。