网站收录

分页和列表翻页的收录:哪些该留、哪些该收口

站点里除了正文页,还有大量翻页 URL:长文拆页、栏目翻页、标签聚合翻页。它们容易被大量抓取,却未必值得都进索引。本文按内容分页和列表分页两类,讲清判断标准、canonical 与收口方式的取舍,以及为什么不要直接用 robots.txt 屏蔽分页。

网站收录

分页和列表翻页的收录:哪些该留、哪些该收口

一个站点的 URL 数量里,正文页往往只占一部分。剩下的很大一块是翻页:长文被拆成三四屏、栏目列表翻到第二十几页、标签页下还有一层层分页。这些 URL 该不该被收录、该怎么标记,很多站点是一刀切的——要么全放开,要么整段 noindex,两种做法都可能留下问题。

先分清两类分页,它们的性质不一样

内容分页:一篇文章被拆成多页

常见于图集、长评测、连载式教程。每一页都承载原文的一部分,把它们拼起来才是完整内容。这类页面的正文是互补关系,不是重复关系。

列表分页:同一批内容换个顺序

栏目列表、标签归档、搜索结果、商品筛选结果翻页。第 2 页和第 5 页的区别常常只是排序位置和几条新条目,页面主体结构、标题、描述高度相似。这类页面之间更接近重叠关系。

判断标准:这一页有没有独立可检索的信息

不要从“是分页”出发做决定,而是问三个问题:

  • 用户直接搜到这个 URL,看到的内容对他是否完整、有用?
  • 它的标题和正文,与同组的其他页是否明显不同?
  • 如果它不进索引,站内还有没有别的入口能触达它里面的链接和内容?

三个问题里有两个以上是否定答案,这一页通常就不必争取收录。

内容分页:保住正文,别把后续页全砍掉

把长文拆页时,常见的错误是给所有后续页加 canonical 指向第一页。这样做的结果是:后续页上的内容几乎无法单独参与检索,而用户从搜索进来时又常常落在第二、三页。

更常见的做法是让每一页自指 canonical,同时保证标题有区分度,例如在标题里带上分页序号或该页的小标题。如果站点更看重整篇内容的完整呈现,可以另外做一个不分页的“全部”页,把它作为规范版本,并让分页指向它。两种思路都能成立,关键是要选一种贯穿全站,而不是同一站里两种混用。

列表分页:越往后越像同一页

栏目页的前几页通常还有收录价值——它们聚合了近期内容,也常被用户直接搜到。翻到几十页之后,页面之间的差异越来越小,主要作用变成“让蜘蛛继续往后走”。

实务上有几种处理方式:

  • 保留可抓取、不加 noindex:让分页链接继续充当爬行通道,是否收录交给搜索引擎判断。对多数中小站点这是省事且低风险的选择。
  • 对深翻页做收口:例如超过一定页数后不再输出可点击的分页链接,或改为按时间归档。收口之前要确认老内容仍有其他入口,否则会切断发现路径。
  • 不给分页单独写标题模板:如果每页标题只是“栏目名 - 第 N 页”,可以考虑统一风格,减少大量近似标题进入索引。

不要用 robots.txt 屏蔽分页

这是最常见也最容易踩的坑。用 robots.txt 屏蔽带分页参数的目录,看起来能减少抓取,但蜘蛛也读不到这些页面上的链接了。列表页里往往藏着最新发布的文章入口,一屏蔽,新页面的内链通路就断了。

要限制的是“进入索引”,不是“被看到”。想收口用 noindex,想省抓取才考虑 robots,两者不要混着用。

一个简单的自查顺序

  1. 把站内所有翻页 URL 按来源分成内容分页和列表分页两组。
  2. 在每组里各抽 5 个页面,看标题、正文、摘要是否高度雷同。
  3. 检查这几页的 canonical 是否自指,全站策略是否一致。
  4. 确认 robots.txt 里没有误伤分页目录。
  5. 检查深翻页有没有完全脱离内链,变成只有蜘蛛能通过旧链接发现的孤岛。
  6. 改动上线后,隔两三周看索引覆盖里的排除原因有没有变化,再决定要不要继续调整。

小结

分页不是收录问题的根源,模板化输出才是。内容分页尽量保住每一页的正文价值,列表分页重点控制尾部大量近似页。收口与否取决于这一页是否解决了一个真实查询,而不是取决于 URL 里有没有参数。改动之后给搜索引擎留出重新抓取和判断的时间,不要隔天看数字没动就再改一轮。