列表页翻到第 20 页也被收录,很多人第一反应是“重复内容太多”。但在动手之前,先分清一件事:分页被收录,可能是负担,也可能是长尾入口。处理方式不同,结果差别很大。
先判断分页有没有独立价值
分页 URL 和第一页相比,差异通常只有列表项和排序。判断是否值得保留收录,可以问三个问题:
- 列表项本身是否有检索价值?比如商品、房源、职位这类有明确搜索需求的条目。
- 翻到后面的页面,是否还会出现在站内导航或内链中?如果只有“下一页”按钮能到达,实际分发价值有限。
- 用户是否可能直接搜索到这一页?如果答案基本是否定的,收录的意义就不大。
分页的收录决策,本质是先判断内容价值,再决定技术处理,而不是反过来。
三种常见处理方式,先想清楚代价
一、放开收录
适合列表项有独立搜索需求的站点。前提是分页 URL 稳定、可抓取,并且每页有自己的标题与 H1,canonical 自指。否则同一个序列容易出现多个版本互相竞争。
二、canonical 指向第一页
这会让搜索引擎倾向于只保留第一页,但也会连带削弱翻页页面上列表项作为入口的价值。如果站点依赖列表页做内链分发,这个操作要谨慎。
三、noindex, follow
页面不进入索引,但页面上的链接仍会被跟随。适合“只想要链接分发、不想要页面本身”的场景。注意 noindex 需要在页面被抓取到的前提下才生效,如果同时用 robots.txt 屏蔽了该路径,两边的指令会互相抵消。
核对抓取路径,别让深翻页吃掉预算
很多站点的翻页是无限延伸的,“下一页”可以一路点到几百页。这类路径的问题不在于收录本身,而在于蜘蛛会把大量时间花在低价值页面上,内容页的重访频率因此被拉低。
- 看抓取日志中翻页 URL 的占比,如果明显高于内容页,说明路径过深。
- 检查是否存在按页码批量生成的入口,比如把全部翻页塞进了 sitemap。
- 考虑对超过一定页数的翻页做收口,保留前面若干页可抓取。
翻页顺序变了,索引也会抖
如果列表按时间或热度排序,翻页内容会不断变化,同一个 URL 今天对应 A 组列表项,明天可能完全不同。搜索引擎每次看到的版本都在变,索引状态就容易波动。如果希望收录相对稳定,可以考虑让分页顺序固定下来,或对排序参数做规范化处理。
索引报表里要看的状态
处理之后不要只看“收录数量变了多少”,还要看状态归类:
- 被选为规范页的是第一页,还是某个翻页。
- “已抓取,尚未编入索引”是否集中出现在翻页 URL 上。
- 同一分页序列是否有多个版本同时被索引。
- 排除原因是否为“重复,未选择规范页”或“已被 noindex 标记排除”。
一份可执行的核对清单
- 确认分页 URL 是否稳定,有没有混入筛选、排序、追踪参数。
- 确认翻页页面上的列表项链接能被抓取,而不是依赖脚本执行后才出现。
- 确认 noindex、canonical、robots.txt 三者的指令不冲突。
- 确认站点地图里没有包含不必要的翻页地址。
- 观察 2 到 4 周的抓取日志与索引状态变化,再决定是否扩大收口范围。
分页收录没有统一答案。先判断价值,再选处理方式,最后用日志和索引状态验证,比一次性关掉所有翻页要稳妥得多。改动后的变化通常需要一段时间才能在报表上体现,不建议根据一两天的数据下结论。