站内的列表页翻到第二页、第三页之后,地址通常会长出一个页码参数。这类页面算不算重复内容、要不要放进索引,很多站点的处理是含糊的:既没有 noindex,也没有 canonical,蜘蛛顺着翻页链一路往下爬,索引里就多出一堆内容高度相似的 URL。这里只谈分页页面的收录取舍,不涉及筛选、排序那类参数组合。
先分清站内几种分页
- 列表分页:文章列表、商品列表按页码切分,第二页之后的内容基本是前一页的延续,但条目本身可能不同。
- 正文分页:一篇文章被拆成多页,每页只有一小段正文,多见于老站或内容平台。
- 评论分页:评论区按页展开,正文只出现在第一页,后面几页几乎全是评论。
- 筛选后的翻页:先按条件筛,再翻页,URL 里同时带筛选条件和页码,数量最容易失控。
哪些分页页面值得进索引
判断标准不是它是第几页,而是这一页有没有独立的、用户可能直接搜到的价值。
- 列表分页里,如果第二页之后仍有大量未被首页覆盖的条目,可以保留收录,但要给每页写清唯一的标题和描述,别整组共用一套。
- 正文分页、评论分页基本没有独立检索价值,通常只保留第一页进索引,其余页面对用户照常可访问,对索引收口即可。
- 筛选叠加页码产生的组合,数量往往呈倍数增长,一般不建议放开,先想清楚有多少组合真的会被搜索。
收口手段怎么选,各自有什么副作用
noindex 还是 canonical
对正文分页、评论分页,常用做法是给第二页之后加 noindex, follow:页面仍可被抓取、链接仍能被跟随,只是不进索引。要注意的是,noindex 页面如果又被别的页面 canonical 指向,信号会互相打架,选一种就好。
对内容确实连续、只是被拆开的列表分页,更常见的做法是让每一页 canonical 指向自身,同时给翻页加清晰的可抓取链接。若把第二页 canonical 指向第一页,等于告诉搜索引擎这页不用留,那么页面上独有的条目也会跟着一起消失。
别忽视分页与主页面之间的链接
不少站点只在页面上放一个下一页,不提供回到第一页或跳到末页的入口,蜘蛛只能一页页走,深度越爬越远。适度提供首尾页与固定步长的跳转,能让靠后的内容不至于埋在十几页之后。
自查顺序
- 从索引里抽一批带页码参数的 URL,看它们进索引的比例和展现情况。
- 按上面四类给分页归类,判断哪些有独立价值,哪些只是导航延伸。
- 检查这些页面当前的 canonical、noindex、robots 设置是否互相矛盾。
- 检查翻页链接是否可抓取:是普通链接,还是必须点击才加载出来的按钮。
- 改动后先看一小批页面的变化,再决定是否全站铺开。
分页本身不是问题,问题是它被当成多少条独立内容来看待。数量判断得越清楚,索引里留下的东西就越接近你希望被搜到的那部分。
最后提醒一句,分页收口的效果通常不会立刻反映在收录数上,索引更新本身有延迟,观察周期建议以周为单位,别因为几天没动静就反复改规则,那样反而更难看出哪一步起了作用。