网站收录

分页 URL 要不要收录:第 2 页之后的取舍

分页地址要不要进索引,没有统一答案。文章从分页 URL 的三种形态出发,说明哪些情况下分页值得保留在索引里、哪些应当排除,并对比 noindex、canonical 与 robots.txt 三种处理方式的适用场景和容易踩的坑,最后给出一份可直接对照的自检清单。

网站收录

分页 URL 要不要收录:第 2 页之后的取舍

列表页翻页几乎每个站都有:文章列表、商品列表、搜索结果都会产生第 2 页、第 3 页。这些地址要不要让搜索引擎收录,没有统一答案,关键看它们对用户和搜索引擎各自意味着什么。

先看分页地址是怎么生成的

常见的分页 URL 有三种形态,处理方式并不一样。

  • 路径式:形如 /list/page/2/,层级清晰,蜘蛛容易识别。
  • 参数式:形如 /list?page=2,容易和其他参数混在一起,也更容易出现重复入口。
  • 点击追加:页面不换 URL,靠脚本往下加载内容,这种情况下并不存在真正的第 2 页地址。

分页有没有独立价值,先问一个问题

可以用一句话做判断:这个分页地址上,有没有用户会主动搜索的独立内容?

  • 商品、文章的深分页,条目本身在详情页各有地址,分页只承担导航作用,通常没有独立搜索需求。
  • 分类下只有两三页,且第 2 页包含明显的品类组合,内容也确实不同,保留在索引里一般没有坏处。
  • 筛选、排序、站内搜索产生的分页,参数组合多到无法收敛,通常不建议收录。

让分页进索引时要注意什么

保留分页收录,前提是它真的能被抓、能被正常渲染。翻页链接要是普通的可点击链接,而不是依赖点击事件才生成;页面上的条目要能通过链接到达各自的详情页,这样蜘蛛顺着分页往下走,才有机会发现更靠后的内容。同时确认分页之间没有互相指向第一页的 canonical,否则收录的意义会被自己消掉。

不让分页进索引时的几个坑

  • 用 robots.txt 屏蔽:蜘蛛抓不到分页,也就无法顺着它发现后面的详情页,深页面的发现速度可能变慢。
  • 用 noindex:蜘蛛仍需抓取才能看到指令,抓取开销照付,但能避免页面进入索引。
  • 把分页 canonical 指向第一页:如果分页确实没有独立价值,这是可以接受的做法;如果它本身有内容价值,这么做等于主动放弃收录。
canonical 和 noindex 同时出现在分页上时,信号容易互相打架。选定一种主要手段,其它设置尽量保持简单。

可以观察的几个信号

分页处理完不必立刻下结论。可以在搜索表现里看分页地址有没有带来过点击;在抓取记录里看蜘蛛访问分页的频率,以及它是停在分页还是继续走到详情页;做收录对账时,看索引中的分页数量和线上实际分页数量差多少。这些数据比“应该收还是不收”的直觉更可靠。

一份简短的自检清单

  1. 分页地址是否稳定、可预测,翻页链接是否能被直接抓取。
  2. 分页上的条目是否都有独立详情页地址,链接是否可达。
  3. 分页与第一页之间是否出现了互相矛盾的规范与索引指令。
  4. 如果不让收录,选择的手段会不会连累详情页的发现。
  5. 处理之后留出时间观察抓取和索引记录的变化,再决定是否调整。

分页本身不是问题,问题往往是分页上的指令前后不一致,或者用屏蔽的方式挡住了自己需要的发现路径。先把这两点理顺,收不收录通常会变得容易判断。