网站收录

翻页 URL 的收录取舍:分页页面哪些该留、哪些该收口

列表页翻页、正文分页、评论分页和筛选后的翻页,URL 表现相似,收录取舍却不一样。本文按四类分页分别说明判断标准,讲清哪些页面适合保留在索引中、哪些更适合收口,并对比 noindex 与 canonical 的常见搭配和自查顺序。

网站收录

翻页 URL 的收录取舍:分页页面哪些该留、哪些该收口

站内的列表页翻到第二页、第三页之后,地址通常会长出一个页码参数。这类页面算不算重复内容、要不要放进索引,很多站点的处理是含糊的:既没有 noindex,也没有 canonical,蜘蛛顺着翻页链一路往下爬,索引里就多出一堆内容高度相似的 URL。这里只谈分页页面的收录取舍,不涉及筛选、排序那类参数组合。

先分清站内几种分页

  • 列表分页:文章列表、商品列表按页码切分,第二页之后的内容基本是前一页的延续,但条目本身可能不同。
  • 正文分页:一篇文章被拆成多页,每页只有一小段正文,多见于老站或内容平台。
  • 评论分页:评论区按页展开,正文只出现在第一页,后面几页几乎全是评论。
  • 筛选后的翻页:先按条件筛,再翻页,URL 里同时带筛选条件和页码,数量最容易失控。

哪些分页页面值得进索引

判断标准不是它是第几页,而是这一页有没有独立的、用户可能直接搜到的价值。

  • 列表分页里,如果第二页之后仍有大量未被首页覆盖的条目,可以保留收录,但要给每页写清唯一的标题和描述,别整组共用一套。
  • 正文分页、评论分页基本没有独立检索价值,通常只保留第一页进索引,其余页面对用户照常可访问,对索引收口即可。
  • 筛选叠加页码产生的组合,数量往往呈倍数增长,一般不建议放开,先想清楚有多少组合真的会被搜索。

收口手段怎么选,各自有什么副作用

noindex 还是 canonical

对正文分页、评论分页,常用做法是给第二页之后加 noindex, follow:页面仍可被抓取、链接仍能被跟随,只是不进索引。要注意的是,noindex 页面如果又被别的页面 canonical 指向,信号会互相打架,选一种就好。

对内容确实连续、只是被拆开的列表分页,更常见的做法是让每一页 canonical 指向自身,同时给翻页加清晰的可抓取链接。若把第二页 canonical 指向第一页,等于告诉搜索引擎这页不用留,那么页面上独有的条目也会跟着一起消失。

别忽视分页与主页面之间的链接

不少站点只在页面上放一个下一页,不提供回到第一页或跳到末页的入口,蜘蛛只能一页页走,深度越爬越远。适度提供首尾页与固定步长的跳转,能让靠后的内容不至于埋在十几页之后。

自查顺序

  1. 从索引里抽一批带页码参数的 URL,看它们进索引的比例和展现情况。
  2. 按上面四类给分页归类,判断哪些有独立价值,哪些只是导航延伸。
  3. 检查这些页面当前的 canonical、noindex、robots 设置是否互相矛盾。
  4. 检查翻页链接是否可抓取:是普通链接,还是必须点击才加载出来的按钮。
  5. 改动后先看一小批页面的变化,再决定是否全站铺开。
分页本身不是问题,问题是它被当成多少条独立内容来看待。数量判断得越清楚,索引里留下的东西就越接近你希望被搜到的那部分。

最后提醒一句,分页收口的效果通常不会立刻反映在收录数上,索引更新本身有延迟,观察周期建议以周为单位,别因为几天没动静就反复改规则,那样反而更难看出哪一步起了作用。