网站收录

分页列表页的收录取舍:页码 URL、加载更多与查看全部怎么处理

列表页翻页产生的第二页、第三页属于哪一类 URL,该不该进索引?本文把分页拆成页码 URL、加载更多、查看全部三种实现,说明各自的收录特点、常见坑与处理顺序,帮你把分页当成内容发现通道来看待,而不是简单地一封了之。

网站收录

分页列表页的收录取舍:页码 URL、加载更多与查看全部怎么处理

列表页、商品页、文章归档都会分页。第二页、第三页这些 URL,是收录问题里最容易被含糊处理的一类:既不想让它们占满索引,又担心封得太死,导致蜘蛛走不到后面的内容。先把分页当成一个“发现通道”来理解,再去决定每个 URL 的收录姿态,思路会清楚很多。

分页页不是详情页的复制品

分页 URL 上通常没有独有内容,只是同一批数据的另一段切片。它的作用主要在两方面:一是让蜘蛛顺着链接爬到更早或更晚的记录,二是给用户提供浏览路径。前者关乎发现,后者关乎体验,收录更像附带结果。判断标准可以简化成一句话:这个页码 URL 对用户有没有独立价值,对爬虫有没有带路作用。两边都是否,就没有必要让它进索引。

三种常见实现,处理方式不同

页码 URL

形如 ?page=2 或 /list/page/2/ 这类地址,一般可抓取、链接可被跟进,是发现旧内容比较可靠的路径,不建议直接用 robots.txt 封掉。robots.txt 管的是抓取,不是收录,被封的 URL 仍可能以缺少描述的形式出现在结果里;而且被封之后,页面里的链接也不再被跟进,后面的分页会被一起切断。更温和的做法是:页面保持可抓取,但不额外做优化,把索引名额留给第一页和详情页。

加载更多与无限滚动

用 JavaScript 追加内容时,如果没有可抓取的链接,蜘蛛往往只能看到首屏那一批记录。可以给“加载更多”一个真实的 a 标签指向对应页码,或者同时保留一个普通分页入口,也可以在首屏 HTML 里放足够多的链接。判断方法很直接:关掉 JS,看还剩多少可点的链接。

查看全部页

把多页合并成一条长列表,确实方便用户一次看完,也减少了 URL 数量。但要留意两点:一是页面体积和加载速度,几十上百条记录一次渲染,移动端体验容易受影响;二是如果查看全部页与分页内容高度重合,需要明确让一个版本作为规范,避免同一批内容出现多个入口。常见做法是让查看全部页指向第一页,或者反过来让分页页指向查看全部页,关键是信号统一,而不是两种指向同时发出。

建议的处理顺序

  1. 先确认分页在站点里承担的作用:纯浏览,还是承担了内容发现。
  2. 检查是否存在可抓取的链接路径,不依赖 JS 能否走到较深的页码。
  3. 决定规范化目标:第一页、查看全部页,还是页码页各自独立。
  4. 再考虑是否限制深分页,比如控制最大页码,或按排序方式收敛。
  5. 最后固定一份抽样 URL 清单,持续观察它们的抓取与索引状态。

深分页要不要放开

如果站点有几万条记录,理论上能生成上千个页码 URL。全部放开,抓取量会堆在几乎没有搜索需求的页面上;一刀切封掉,又可能让老内容失去入口。折中办法通常是:保留正常分页路径,让蜘蛛可以顺着走,但不主动推送后半段页码;同时用分类、标签、榜单、相关内容等入口,把重要内容从另一条路重新暴露出来。这样即使深分页被冷落,内容本身也不至于失联。

分页 URL 的收录,本质上是“要不要留一个入口”的问题,而不是“要不要让这个 URL 变成结果”。把入口和索引分开看,处理时少一些纠结。

另外,别只盯某一个页码有没有被索引。更值得记录的是:从第一页到第 N 页,蜘蛛实际走到了第几页,用了多久,之后哪些详情页被发现了。这些数据比单个页码的收录状态更能说明分页路径是否真的在起作用。