网站收录

分页 URL 要不要收录:先判断列表页有没有独立价值,再决定保留、归并还是收敛

分页 URL 该不该进索引,取决于列表页本身有没有独立价值。本文把内容列表分页、长文分页、筛选结果分页拆开看,给出保留自指 canonical、归并到第一页、noindex 收敛三种处理方式,并说明为什么可以不收录但仍允许被抓取,最后给出上线后的核对顺序。

网站收录

分页 URL 要不要收录:先判断列表页有没有独立价值,再决定保留、归并还是收敛

分页是列表页最常见的变体:分类第二页、标签第三页、搜索结果第 N 页。这些 URL 该不该进索引,没有统一答案,取决于分页页面上有没有用户会主动搜索的独立内容。先判断价值,再选处理方式,比直接套一条规则更稳。

先分清站内三种“分页”

外观相似,处理逻辑完全不同:

  • 内容列表分页:文章列表、商品列表的第 2、3 页。页面主体是标题和摘要,偏导航性质。
  • 长文分页:一篇教程被拆成 page=1/2/3。每页都承载独立正文,通常应让第一页自指 canonical,或直接改成一页展示。
  • 站内搜索或筛选结果分页:参数组合容易爆炸,往往是抓取配额的黑洞,处理优先级最高。

判断分页有没有独立价值的几个问题

  • 用户会不会用“某个分类 第 2 页”这类词来搜索?多数情况下不会。
  • 第二页上的条目,是否已经通过其他入口被链接到?如果去掉分页就发现不了,那分页承担的是发现职责。
  • 分页页面的标题和描述,是否只是复制第一页?重复度越高,独立价值越低。

三种处理方式的适用场景

保留:让每页自指 canonical

当列表本身就是被搜索的目标,且分页有差异化标题、内容能稳定更新时,可以让每页自指,并在标题里带上页码或时间范围。要注意翻页后的条目会不断变动,页面内容频繁变化,索引结果也可能随之波动,这属于正常现象。

归并:canonical 指向第一页

列表页只是导航、条目本身各有独立详情页时,常见做法是把 page=2、page=3 的 canonical 指向第一页,让信号集中。需要确认的是:第一页确实能通过正常导航到达,且不是 noindex 状态,否则归并就成了把所有分页一起推出索引之外。

收敛:不让人抓,或改成交互

参数组合过多、页面价值极低时,可以用 robots.txt 屏蔽带分页参数的路径,或在页面级加 noindex。也可以把“下一页”改造成按钮式加载或滚动加载——但这会切断爬虫顺着链接发现深层内容的路径,需要配合其他发现方式。

别忽略分页在 URL 发现里的作用

很多新文章的第一条发现路径,就是从列表第一页顺着“下一页”被爬到的。如果直接屏蔽所有分页,等于关掉了一条稳定的发现通道。

处理分页时,建议把“要不要收录”和“要不要被抓”分开看:可以不收录,但仍允许被爬取,用来传递发现路径。

比较稳妥的组合是:不彻底屏蔽分页路径,而在页面级用 noindex 控制是否入索引;同时在 Sitemap 里直接提交详情页 URL,减少对分页链路发现的依赖。

上线后的核对顺序

  1. 在抓取日志里按分页参数分组,看爬虫把配额花在哪一层,尤其是翻到很深的页码。
  2. 用索引状态查询确认分页 URL 实际是“已收录”“已排除”还是“已发现未编入”。
  3. 抽查几个分页的 canonical,确认它指向的页面本身是可被索引的。
  4. 对比详情页的收录覆盖率有没有因为分页调整而下降,重点看新发布的内容。
  5. 观察一到两个抓取周期再决定是否继续收紧,避免一次性改动过大。

分页处理没有一步到位的答案。先想清楚这个列表页对用户和爬虫分别有什么用,再在保留、归并、收敛中选一个组合,并留出观察期,通常比追求“统一规则”更省事。