网站收录

翻页和列表页的收录取舍:canonical 指向第一页是不是好做法

分类页、标签页和列表的翻页地址,是站点里数量最多、内容最相似的一批页面。本文讨论翻页页面要不要收录、canonical 指向第一页在什么情况下会失效、noindex 与站点地图为什么会互相矛盾,以及从抓取预算角度该怎么安排分页入口。

网站收录

翻页和列表页的收录取舍:canonical 指向第一页是不是好做法

列表页和翻页页面到底算不算内容

分类页、标签页、搜索结果页,以及列表的第 2 页到第 N 页,通常由模板生成,正文是若干标题和摘要的组合。它们对用户有价值——用户确实会翻页找东西——但对搜索引擎来说,独立性很弱:去掉翻页导航后,第 2 页和别的列表页差别不大。

于是就出现了取舍:全部放开收录,会带来大量近似页面;全部屏蔽,又可能切断爬虫发现深层内容的路径。

三种常见处理方式和各自的代价

canonical 指向第一页

做法是把 /list?page=2 到 /list?page=N 的 canonical 都指向 /list。表面上是把信号集中了,但搜索引擎不一定接受:如果它判断这些页面的内容确实不同,canonical 可能被忽略。更麻烦的是,如果第一页只展示最新十篇文章,而第五页的文章在别处没有任何内部链接,这些文章就很难被发现。

所以这种做法更适合「翻页只是同一批内容的重新排列」的场景,不适合「每页承载不同文章链接」的场景。

加 noindex

noindex 的页面仍然可以被抓取,链接还是能被发现,这是它的优点。但要注意两点:一是 noindex 页面如果同时提交进站点地图,信号自相矛盾;二是被 noindex 的页面难以传递链接信号,如果页面上挂着重要链接,损失是实打实的。

放开收录但把 URL 收敛干净

有些站点不限制收录,而是控制参数:只允许一种参数顺序、禁止会话参数和排序参数进入可抓取范围、给每种筛选组合一个稳定地址。前提是 URL 变体管得住,否则参数组合会爆炸,反而制造出更多重复地址。

抓取预算的角度

翻页链条往往很长。如果每页只有十条链接,而站点有几十万条内容,爬虫需要走非常深的翻页路径才能覆盖。此时更有效的做法是让列表页提供足够入口(加大每页条数、增加年份或字母索引页),而不是纠结翻页本身要不要收录。

抓取预算的本质不是「爬虫能爬多少」,而是「你希望它优先爬什么」。

自查顺序

  1. 先看翻页 URL 的参数规则是否稳定,有没有排序、会话、追踪参数混进来。
  2. 用日志确认爬虫实际访问了多少翻页页面、是否在深翻页上反复消耗。
  3. 确认目标内容页是否都有不依赖翻页的内链入口。
  4. 再决定策略:只收敛参数、加 canonical,还是 noindex。同一批 URL 上不要叠加使用。
  5. 改完后观察抓取分布的变化,而不是只盯着索引总量。

小结

翻页和列表页的收录没有统一答案。判断标准可以简化成两个问题:这些页面被单独召回时,用户会不会觉得答非所问?不依赖它们,深层内容还能不能被爬到?这两个问题的答案,基本就决定了该收敛还是该放开。