搜索抓取

列表页的分页与归档:蜘蛛能翻到多深,取决于链接怎么写

列表页是蜘蛛除首页之外最常走的路径,翻页链接写得对不对,直接决定靠后的 URL 能不能被发现。本文从三种常见翻页写法的差异、分页地址的处理规范、归档页对老内容的暴露作用,以及筛选排序参数带来的抓取浪费几个角度,讲清楚怎么让分页真正成为一条可用的抓取通道。

搜索抓取

列表页的分页与归档:蜘蛛能翻到多深,取决于链接怎么写

列表页是蜘蛛的第二入口

除了首页和栏目页,蜘蛛最常走的路径之一就是列表页。它把一批 URL 集中暴露出来,翻页链接决定这些 URL 能被翻到第几屏。如果翻页只能靠点击触发、地址栏不变,靠后的内容在抓取路径上就会断掉。

三种常见的翻页写法

  • 独立地址的分页链接:形如 /list/?page=2、/list/page/2/,每页都是普通链接,蜘蛛可以一页页跟下去。
  • 点击加载更多:按钮绑定脚本事件,地址栏不动。蜘蛛执行脚本时可能拿到新 URL,不执行就停在第一页。
  • 滚动加载:没有可点击的链接,翻页由滚动触发,抓取路径基本无法延续。

如果站点用的是后两种,建议保留一个传统分页入口,比如「下一页」的链接或按页码拆分的静态路径。不必每页都做成独立页面,但至少要留一条能被跟下去的线。

分页 URL 要能直接打开

  • 分页参数变化时,页面主体内容应随之变化,而不是始终返回第一页的内容。
  • 第二页及之后的页面不要指向首页或第一页的 canonical,否则蜘蛛容易把两者当成同一份内容。
  • 分页页面的标题与列表项要能正常输出,不要依赖登录或表单提交才看得到。
  • 如果产品有「查看全部」视图,注意它和分页视图的地址关系,避免两套地址互相争夺同一个位置。

归档页和时间轴:让老内容再被翻到

新内容靠在首页和栏目首页,老内容的入口会越来越浅。按月份、标签、分类做的归档页,是把老 URL 重新拉回抓取路径的方式之一。做法上注意两点:归档页本身要能翻页,否则翻到第一屏就结束;归档页要真的有内容,空标签页、只有一两条记录的归档页价值不大,数量和层级都要克制。

别让分页掉进参数泥潭

排序、筛选、视图切换如果都写成 URL 参数,很容易组合出成千上万个地址。这些地址大多内容相近,蜘蛛跟进去只会消耗抓取资源,对 URL 发现帮助有限。常见处理是:保留少量有价值的筛选组合,其余用 robots 规则屏蔽,或者让链接不被继续跟。

判断标准很简单:这个地址是否有独立的内容价值。有,就让它进抓取路径;没有,就别让蜘蛛把时间花在上面。

怎么检查分页是不是真的通

  1. 在日志里看列表页的分页地址有没有被访问,访问到第几页。
  2. 用抓取工具模拟一次,确认翻页链接是普通链接,且能一路点到最后一页。
  3. 检查分页页面的标题、canonical 和列表内容是否正常变化。
  4. 对重要的归档页,可以在站点地图中单独列出,但不必把所有分页地址都塞进去。

分页不是新鲜话题,但它决定了蜘蛛能不能沿着你设计的路线,把站点里的老内容一页页翻出来。把链接写清楚、把参数收干净,比事后补 Sitemap 更省事。