网站收录

分页列表页的收录取舍:页码 URL 的保留、规范化与抓取顺序

列表页翻到第二三十页,会自然产生大量页码地址,这些地址该保留还是收口,关键不在重复内容本身,而在于链接与权重是否被摊薄。本文把参数分页、路径分页和异步翻页分开讨论,给出从规模统计、入口排查到保留层级、内容页入口核对的收口顺序。

网站收录

分页列表页的收录取舍:页码 URL 的保留、规范化与抓取顺序

列表页和分页页是站内 URL 数量最容易失控的一类。一个栏目翻到第 30 页,就可能多出 29 个地址;再叠加上排序、筛选参数,同一个列表能变出几十种写法。这些页面被收录本身不算坏事,麻烦的是它们稀释了站内链接、占用抓取额度,还容易和真正想被搜到的内容页抢位置。处理分页,重点不在「要不要收录」,而在「哪几页值得留、剩下的怎么收口」。

一、先把分页的三种形态分开

不同形态的分页,抓取路径和收录表现完全不同,混在一起讨论很容易得出错误结论。

  • 参数分页:例如列表地址后接 ?page=2。这类地址通常由翻页链接自然产生,蜘蛛顺着链接一路爬下去,常见问题是页码参数被当成可索引内容,生成大量近似重复页面。
  • 路径分页:例如 /list/page/2/。结构更清晰,适合用序列关系标记或单独的站点地图来表达,但也因为路径独立,更容易被单独收录甚至参与排名。
  • 异步翻页:点击「加载更多」后由前端追加内容,原始 HTML 里只有第一页。搜索引擎可能通过渲染拿到后续内容,也可能完全看不到,取决于具体实现。

二、别急着设不索引,先看这页有没有用

不少人一发现分页被收录,第一反应就是加不索引标记。但这会阻断链接传递,可能导致更深的页码彻底失去被发现的机会。更稳妥的判断顺序是:

  1. 这个分页上是否只有内容摘要和重复导航?如果是,它大概率没有独立搜索价值。
  2. 分页是否是站内重要的发现路径?如果是,链接仍然需要被抓取,但不必让这页参与排名。
  3. 列表本身是否沉淀了不可替代的信息,比如按时间整理的全量清单、带明确维度的聚合?如果确实有,就不该一刀切处理。

换句话说,「可抓取」和「可索引」是两件事,分页页最典型的处理方式就是保留抓取、限制索引。

分页问题的本质不是重复内容本身,而是链接和权重被摊薄到了大量低价值地址上。

三、按顺序收口的操作步骤

  1. 先统计规模。用日志或抓取工具,看分页 URL 占被抓取地址的比例,再对比索引里分页页的实际数量。这一步决定后面要投入多少精力。
  2. 再看入口。分页页的入口通常来自上一页的翻页链接。确认这些链接是普通超链接,还是由脚本拼出来的,后者要先解决可抓取性问题。
  3. 确认规范化写法。同一组分页固定用同一种 URL 形式,避免参数、路径、尾斜杠混用,也避免排序、筛选参数和分页参数搅在一起。
  4. 决定保留层级。常见做法是保留前几页,对更深页码做收口;或者只让第一页参与排名,后续页保留抓取但不索引。
  5. 检查内容页入口。分页页往往承担着把蜘蛛送进内容页的任务。收口之前先确认内容页还有别的入口,比如分类页、相关推荐、站点地图,否则可能出现内容页抓取量下降。
  6. 观察一到两个抓取周期。看索引变化和内容页的抓取情况,再决定是否继续收紧。

四、几个容易忽略的点

  • 排序参数常和分页参数同时出现,产生组合膨胀。这类参数建议单独处理,不要指望分页方案一并解决。
  • 「加载更多」如果只改哈希或只做 DOM 追加,后续内容对蜘蛛可能不可见,此时需要给每页一个可访问的独立地址。
  • 分页页的标题和摘要如果全部一样,即使被收录,也很难获得点击,关键分页可以考虑补充区分度。
  • 收口方式改变后,索引不会立刻同步,短时间内看到「没变化」是正常的,不要反复改策略。

总结一句:分页收录的核心是把「发现链接」和「参与排名」分开处理。先分清形态,再判断价值,最后按入口、规范、保留层级、内容页入口的顺序逐步推进,比一上来批量设不索引要稳妥得多。