网站收录

列表页与分页序列:第几页之后,收录其实没那么重要

分页页面常被当成收录指标的一部分来盯,但它在抓取链路上首先是一条路径,其次才是一个页面。本文拆解参数式与路径式分页的差别,说明哪些分页值得被收录、哪些不必强求,以及无限滚动和加载更多该怎么留出可抓取的入口。

网站收录

列表页与分页序列:第几页之后,收录其实没那么重要

做内容站的人常会盯着收录数看,然后发现一个现象:首页、栏目页、文章页都进了索引,唯独 /page/2/、/page/3/ 这类分页几乎查不到。有人因此去改链接、调参数,甚至怀疑是不是站点出了问题。多数情况下这不是异常,而是分页在抓取和收录这件事上本来就排在后面。

分页首先是一条路径

分页有两个身份:它是一条通往深层内容的链接路径,也是一个独立页面。对站点来说,前一个身份更重要。

搜索引擎沿着第一页上的链接继续往下走,才能发现那些没被内链直接指向的老文章。所以分页能不能被抓到,比它自己能不能被收录影响更大。

反过来看,一个分页的正文往往只是列表项的重复排列,本身没有额外信息。当站点 URL 数量很大时,抓取会优先给到内容页、栏目页,分页被排在后面属于正常分配,不必过分解读。

三种常见的分页写法

  • 参数式:/list?page=2,写法简单,但容易和筛选、排序参数叠加,产生大量近似 URL
  • 路径式:/list/page/2/,在日志里看起来清楚,层级关系也直观
  • 混合式:分页参数和视图、排序参数混在一起,比如 /list?p=2&sort=price&view=grid

如果你的分页带了排序、视图这类可选参数,最好让这些参数不要生成新链接,或者让带参数的分页 canonical 到不带参数的分页版本。否则同一页列表会出现十几种 URL,抓取和收录都会被稀释。

哪些分页值得被收录

  • 页面上除了标题和列表,还有一段说明文字,能独立回答某个浏览需求的
  • 作为专题或榜单的浏览入口,用户确实会一页页往下翻的
  • 内容量很大,第一页完全覆盖不到深层条目的列表页

如果分页只是导航,通常不必强求收录。让它保持可抓取、能正常传递链接关系,已经完成了主要任务。

哪些分页不必花力气

  1. 纯导航式分页,页面上除了重复的标题和列表没有任何说明
  2. 与第一页高度相似的列表,只是条目顺序换了一下
  3. 由排序参数批量生成的分页,如按价格、按时间、按热度排列的各种组合
判断标准可以简化成一句话:这个分页被单独搜到时,用户能不能得到列表之外的一点东西。

无限滚动和加载更多要留退路

用脚本做无限滚动很常见,但如果没有可抓取的链接入口,深层内容就会变成孤岛,只能靠 sitemap 和站内其他入口去补。可行的做法是:页面底部保留一套普通的分页链接,视觉上可以低调处理,但要保证是真实的 a 标签,能被正常跟随。

另一个容易踩的坑是把分页序列互相 canonical 到第一页。分页之间的内容并不相同,这么做等于告诉搜索引擎只保留第一页,深层条目反而可能失去发现路径。分页用自引用 canonical 就够了。

自查顺序

  1. 抓一份日志,看爬虫是否访问到第 2、3 页,访问频率大概是多少
  2. 用网址检查工具看某个深层分页是否被抓取、是否进了索引
  3. 确认分页链接是真实的 a 标签,而不是绑定在 JS 事件上的假链接
  4. 检查分页没有被 robots.txt 屏蔽,也没有被全站 noindex 规则误伤
  5. 看深层文章是否还有别的入口,比如标签页、相关推荐、sitemap

分页收录不理想,通常不说明站点有问题。真正需要留意的是抓取路径被堵住——那往往是后面一连串收录问题的起点。