网站收录

分页列表的后续页码被收录:从入口页到深层分页的核对顺序

分页列表的 page=2、page/3 常被单独收录,也可能长期不被索引。本文按从入口页到深层分页的顺序,核对 URL 写法、canonical 指向、标题描述、内链深度与站点地图,帮助判断分页该保留、该收敛还是该排除索引。

网站收录

分页列表的后续页码被收录:从入口页到深层分页的核对顺序

分页为什么会被单独收录

列表页、商品列表、文章归档常常被拆成 page=2、page=3 这样的多页。对搜索引擎来说,每个页码都是一个独立 URL,只要能抓到、能解析,就有可能进入索引。问题不在于“能不能被收录”,而在于这些地址在索引里扮演什么角色:是帮用户找到深层内容,还是只是重复了第一页的标题和摘要。

先分清两件事:抓取是蜘蛛访问并下载页面,索引是把页面放进可检索的库。分页被频繁抓取但不进入索引,是常见结果,并不代表配置出错。反过来,如果分页大量进入索引,也可能意味着入口页的质量信号被稀释。

核对顺序:从入口页往深处走

第一步:确认页码 URL 的统一写法

同一个第二页可能出现 ?page=2、/page/2、?paged=2、#page2 等多种形式。先统一成一种,其他形式 301 到规范地址。用 # 锚点写的“翻页”不会被当成新页面,如果站内链接只写成锚点,深层内容可能永远不被发现。

第二步:看分页自身的 canonical

常见两种做法:分页 canonical 指向第一页,或者指向自身。指向第一页时,搜索引擎更可能把后续页码合并到入口页,深层条目获得单独抓取的机会下降;指向自身则等于承认分页是独立地址。选哪种取决于内容组织方式,但同一个站点应保持一致,不要一部分指向首页、一部分指向自身。

第三步:检查分页的标题与描述

如果第 2 页到最后一页都用同一个标题和同一段描述,索引里出现多条几乎相同的摘要并不奇怪。可以在标题里加入页码或分组标识,让每页有可区分的主题。

分页本身不是“坏页面”,判断标准是它是否提供了与入口页不同的内容集合,以及用户是否真的会从搜索结果进入这一页。

第四步:确认蜘蛛能走到第几页

很多站点的列表只有“下一页”,第 10 页之后不存在可点击路径。这种情况下,深处内容只能靠站点地图或站内搜索被发现。可以用抓取日志统计页码参数的访问分布,看蜘蛛实际停在哪里。

  • 第一页被抓取次数远高于后续页,属于正常;
  • 第 3 页以后完全没有访问,说明路径或内链存在问题;
  • 同一页码被反复抓取但内容未变,检查返回头与缓存设置。

第五步:决定收录策略并保持一致

  1. 列表内容本身需要被检索的:保留分页可抓取,规范到自身,标题做区分。
  2. 只是浏览入口的:允许抓取但用 noindex 排除索引,注意 noindex 不影响抓取,深层条目仍有机会被发现。
  3. 已经有“查看全部”页面的:把分页指向它,并检查该页面体积是否过大。
  4. 筛选参数、排序参数和页码混在一起的:先按参数维度收敛,再处理页码。

策略定下来后,同步更新站点地图与内链:不要在站点地图里提交已经 noindex 的地址,也不要让内链把蜘蛛送到 301 跳转链的中间节点。

观察与调整

调整后不要只盯着索引数量这一个指标。可以关注抓取分布是否从大量重复分页转向深层条目、入口页的抓取频次是否变化、站点地图中被抓取的比例。最终收录与否由搜索引擎决定,我们能做的是把 URL 形态、内容差异和发现路径整理清楚。