列表页翻到第 2 页、第 3 页,要不要让它们进索引?这个问题看起来只是加不加一个标签,实际牵扯到抓取预算、重复内容判断和用户进入路径。处理顺序弄反,常见的结果是:该被发现的深层内容没被发现,一堆高度相似的列表却占着索引位。
先分清楚是哪一类分页
同样叫“列表页”,性质差别很大,处理方式也不一样。
- 内容型列表:每页展示不同的商品、文章、职位,翻页后内容确实变化,每个页面都有独立的条目集合。
- 纯翻页型:第 2 页只是第 1 页的延续,标题、描述和主体结构高度相似,缺少独立信息。
- 筛选参数型:由排序、价格区间、标签组合生成,URL 数量可以不断膨胀。
分类没做,直接统一加 noindex 或者统一 canonical 到第一页,都会误伤。比如把内容型列表全部 canonical 到第一页,等于告诉搜索引擎后面几页的内容属于第一页,深层条目可能因此更难被单独发现。
三种常见处理方式与各自代价
1. canonical 指向第一页
适合翻页内容高度重合、每页没有独立价值的场景。代价是指向必须一致:如果第 2 页 canonical 到第 1 页、第 3 页又 canonical 到第 2 页,形成链条,后续核对会很混乱。另外,canonical 的目标本身必须是可被索引的页面,否则等于把整组页面都推向一个不参与索引的地址。
2. 加 noindex
适合筛选参数页、排序页这类低价值组合。要注意 noindex 只影响索引,不影响抓取,蜘蛛仍会来爬。如果这类 URL 数量巨大,需要配合内链控制、robots.txt 或参数处理一起收口,否则抓取会持续被消耗。
3. 保持可抓取、可索引
适合每页都有独立条目、用户确实会翻页浏览的列表。这种情况下要做的是标题、描述、筛选入口的差异化,而不是一刀切屏蔽。
一个关键判断:如果没有第 N 页,某个深层页面还能不能被用户和蜘蛛通过别的路径找到?如果找不到,分页本身就是一条重要路径,收得太狠会伤到内容发现。
一个可执行的核对顺序
- 抓取几条分页 URL,确认实际返回的状态码、canonical 和 meta robots,不要只看模板文件。
- 把分页按上面三类归堆,列出每一类对应的 URL 模式,数量和大致占比。
- 检查翻页链接是否为真正的 a 标签。翻页按钮如果是 JS 渲染或纯点击事件,蜘蛛可能拿不到后续 URL。
- 确认第一页与后续页的差别是否只是数字,标题、H1、描述是否完全复用。
- 对决定不收的类别,统一加 noindex 并指定一个规范版本;对决定收的类别,检查内链和站点地图是否覆盖到关键页面。
- 观察一段时间后,对照索引状态,看是否出现集中在分页 URL 上的“已抓取尚未索引”或重复归并。
容易被忽略的两点
一是 rel="next" / rel="prev" 早已不是索引信号,不要再指望它解决重复问题。它可以作为爬取提示保留,但决策还得靠 canonical、noindex 和内链。
二是分页与站点地图的关系。把第 2 页之后全部塞进 sitemap 通常没有好处;反过来,把深层条目的直链补进内链或 sitemap,往往比分页本身被收录更有价值。
分页处理没有通用答案,只有先分类、再定策略、最后核对实际输出这一条顺序。把它当成一个个页面来判断,比直接套模板更省事,也更容易在索引报告里看出问题。