列表页、文章归档页、商品列表页翻到第二页、第三页,甚至第几十页,也被搜索引擎收录了。这不一定是坏事,但也不一定是好事——分页地址和普通内容页的定位不同,处理方式也应该分开看。
先搞清分页页在收录里扮演什么角色
分页地址通常有两个身份:一是给用户翻页用的导航,二是给蜘蛛往深处爬的路径。前者决定它有没有必要出现在搜索结果里,后者决定你能不能把它整条屏蔽掉。这两个身份经常被混在一起讨论,结果就是要么全留、要么全挡,两种做法都容易留下后遗症。
很多站点在做检索结果页或商品列表时,第一页承担了主要的关键词价值,第二页之后的独立搜索需求明显下降。如果这些地址被大量收录,索引里就会多出很多内容近似、标题也近似的页面。
分页被收录的三种典型情况
1. 纯翻页,内容只是同一批条目的不同顺序
这类页面对用户和搜索引擎的独立价值都很低。收录了不会直接带来什么问题,但会占用索引空间,也可能让爬虫把时间花在重复地址上。判断标准很简单:把第二页和第一页的标题、描述、正文摘要放一起看,如果几乎看不出差别,基本就是这一类。
2. 分页里出现了第一页没有的条目
比如商品按上架时间固定排序,第二页开始有第一页看不到的商品;或者归档页按月份切分,翻页即换内容。这种情况下分页是需要被发现的,尤其是新上架的条目只能通过翻页进入时。
3. 分页是唯一入口
如果站点只靠“下一页”把所有条目串起来,而没有任何分类、标签或 sitemap 作为补充路径,那么把分页挡住,等于把深层页面一起藏起来。这一条在动手之前一定要先确认。
处理方式与各自的代价
- 保留并自指 canonical:分页作为独立 URL 保留,canonical 指向自己。适合有独立内容、或者承担发现任务的分页。
- canonical 指向第一页:把后续页的权重合并到第一页。代价是这些分页基本不会以自身身份出现,而且如果指向过于集中,第一页接收到的重复信号反而变复杂。
- 加 noindex,follow:页面不进索引,但链接仍可被跟随,深层地址还能被发现。这是比较常用的折中做法。
- robots.txt 屏蔽:抓取被直接切断,链接也跟不了。除非这些分页确实没有任何需要发现的下游地址,否则不建议用。
几个容易踩的坑
- 把所有分页一刀切 noindex。如果详情页只能靠翻页进入,发现速度会明显变慢。
- canonical 全部指向第一页,却没同步处理分页自身的标题和描述。容易让搜索引擎对整组页面的判断变模糊。
- 只做无限滚动,不给可抓取的翻页链接。用户能一直滑下去,蜘蛛可能停在第一批条目上。
- 分页 URL 形式不统一。?page=2、/page/2、?paged=2 混用,会让同一批内容出现好几套地址,收录口径也就跟着乱。
一个相对稳的处理顺序
先把分页的 URL 形式统一,只保留一种;再逐个判断分页是不是承载独立内容或发现任务:是,就保留并自指;不是,就用 noindex,follow。最后回头检查有没有别的路径能到达深层页面——分类、标签、站内搜索、sitemap 都算。如果这些路径都齐了,分页的价值主要就回到用户体验上,收录与否就没那么关键了。
分页的取舍本质是一个分配问题:你希望搜索引擎把精力花在翻页地址上,还是花在每一件条目本身上。
还有一点,分页被收录之后,不建议立刻大批量改成 noindex。索引更新本身有滞后,短时间内你会在报表上看到“收录没掉、状态没变”,这属于正常节奏,不必来回调整策略,反而容易让整组页面的信号反复摇摆。