网站收录

内容被拆成多页:收录核对先判断分页该不该单独进索引

文章或列表被拆成多页后,索引里常出现同一组内容的多个地址。核对收录时,先分清哪些分页承载了独立价值、哪些只是同一份内容的切片,再决定保留收录、合并到一个地址,还是用 noindex 收口。

网站收录

内容被拆成多页:收录核对先判断分页该不该单独进索引

很多站点的收录问题不是出在首页或详情页,而是出在分页上。一篇文章被拆成五页,一个列表被翻成几十页,结果索引里同一组内容出现了多个地址。核对时如果不先把分页这一类拆出来看,很容易把“总量涨了”误判成“收录变好了”。

先分清三类分页

不是所有翻页都该用同一套处理方式,核对前先按来源归一下类。

  • 真分页:内容确实太长,一页放不下,或者列表条目确实多,需要分批呈现。每一页都有用户会直接搜到、用到的可能。
  • 伪分页:为了增加浏览量,把本可以一页讲完的内容切成多页,每页正文只有几百字,标题几乎一样。
  • 筛选与排序:分类、价格区间、排序方式产生的地址,本质上还是同一批条目换了顺序或做了过滤。

三类里,只有第一类值得认真考虑单独收录,后两类通常需要收口。

在索引里怎么核对

打开站点的收录核对表,把带分页特征的地址单独列一列,可以按 URL 里的页码段、page 参数、斜杠加数字这几类去筛。

  1. 数一下分页地址在总收录量里占多大比例。如果超过三成,先别急着看新增,先看看主页面有没有被挤掉。
  2. 抽十来个分页,逐条对比标题、H1 和首屏摘要。如果除了页码数字几乎完全一致,这些页面在索引里大概率会互相竞争。
  3. 看主页面是否稳定:第一页收录正常,还是反而被后面的页码页替换掉了展示位置。
  4. 看抓取记录里分页的占比。深翻页消耗的抓取次数如果明显偏高,正文页的更新就容易被延后。

处理方式要分情况选

真分页

如果每页确实有独立内容,建议给每一页写单独的标题和摘要,别只在标题后面加个“第几页”。同时保持页面之间用普通的 a 链接互连,前后页都能直接点到,不要只靠滚动加载。

伪分页

优先合并回单页。合并后只保留一个地址,原分页地址做跳转或返回合适的状态码,不要留着两个内容高度相似的页面同时可访问。

筛选与排序页

保留有搜索价值的那几种组合,其余用 noindex 收口,但链接仍然要能被跟踪,不然里层的条目页会变得很难被发现。

几个容易踩的坑

  • canonical 全部指向第一页:如果后面的页面确实有自己的内容,这么做等于告诉搜索引擎这些页面是重复的,它们很难再被单独收录;如果内容本来就相同,那更应该做的是合并,而不是留着一堆可访问的地址。
  • 依赖 rel=next/prev 做归并:主流搜索引擎已经不再把它当作收录信号,别把它当成唯一的处理手段。
  • 把分页全塞进 sitemap:sitemap 是发现入口,不是收录清单。深翻页大量出现,会稀释真正需要更新的正文页的抓取机会。
  • 给分页加 nofollow:这会让更里层的内容更难被爬到,通常不是想要的结果。
判断标准可以简化成一句话:这个分页地址单独拿出来,能不能回答一个用户会主动搜索的问题。能,就给它独立身份;不能,就收口到主地址上。

改完之后怎么验证

分页的调整不会立刻反映在索引里,建议只改一类,然后固定周期观察三个指标:分页地址的收录数量是否下降、主页面是否保持稳定收录、正文页的抓取次数是否回升。三者一起看,比只盯收录总量的涨跌更有意义。