网站收录

列表页翻到第二页之后:分页要不要收录,怎么梳理抓取路径

列表页的分页既服务于用户浏览,也承担着让蜘蛛走到深层详情页的任务,但这两件事的目标并不一致。本文按可达性、URL 形态、canonical 指向、路径无限延伸的顺序梳理分页处理,并列出几个容易被忽略的细节和可以观察的指标。

网站收录

列表页翻到第二页之后:分页要不要收录,怎么梳理抓取路径

列表页的分页看起来只是一个小功能,但它同时承担两件事:让用户看完更多条目,让蜘蛛沿着链接走到更深的详情页。这两件事的目标并不完全一致——用户需要翻页,而蜘蛛只需要能顺着链接一路走到底。很多站点在这里犯的错误,是把“分页可抓取”和“分页要收录”当成同一件事。

先分清分页的两种角色

在判断分页该不该进索引之前,先问一个问题:这一页除了把第一页的条目往后挪了几位,还有没有独立内容?

  • 纯翻页页:第 2、3、4 页只是第一页的延续,标题、描述、侧栏几乎一样,正文只有不同的条目摘要。这类页面通常没有独立的检索价值。
  • 带筛选语义的列表页:例如“某城市 + 某品类”,它对应的是用户会主动搜索的组合,本身就是着陆页,应当作为独立 URL 对待,而不该被当成普通分页。

把这两类混在一起处理,是分页问题最常见的源头:该独立的被当成分页,该收敛的被当成着陆页,结果要么详情页发现不到,要么索引里塞满相似列表。

核对顺序

  1. 先看详情页是不是全部可达。用日志确认蜘蛛是否抓到过位置较深的详情页。如果分页靠按钮事件触发,点击“加载更多”才拼接内容,蜘蛛很可能走不下去。抓不到,后面所有讨论都没有意义。
  2. 再看分页 URL 的形态。?page=2 这类参数如果可以被任意组合、任意排序,会衍生出大量近似地址。核对是否存在无意义的参数叠加,以及默认排序是否也能生成一个带参数的地址。
  3. 然后决定 canonical 指向。如果分页不需要独立收录,让它自我引用、把链接留在页面上,通常比直接指向第一页更稳妥——指向第一页会被当作重复项合并,链接一般仍会被跟随,但抓取分配可能被削弱。是否这样处理,要结合自身抓取情况观察。
  4. 最后检查翻页路径会不会无限延伸。带日期、带随机排序、允许回溯大量历史页的列表,容易形成蜘蛛翻不完的路径。这类入口要主动收敛。

顺序不能颠倒。先解决可达性,再谈收录取舍;先减少无意义地址,再谈 canonical。

几个容易被忽略的细节

  • 分页页的标题和描述如果和第一页一模一样,被收录后属于同质结果,不收录又浪费了可以表达的差异,两种做法都要有意识。
  • 移动端常见“上拉自动加载”,桌面端才是翻页。核对时不要只测桌面,也不要用浏览器渲染后的结果替代原始 HTML 做判断。
  • 列表翻到很后面的页面,条目往往早已下架,翻页地址仍可访问,返回一堆空壳。这类页面即使被抓到,也难有收录价值。
  • 分页数量随库存变化,昨天第 20 页存在、今天只剩 15 页,残留地址却返回 200 而不是 404,会持续消耗抓取。

什么时候可以接受分页进索引

如果分页页自身有足够的独立信息,比如聚合了不同评论、不同排序下确有差异的内容,并且用户确实会从搜索直接落到这一页,那么让它保持可索引是合理的。判断依据是用户价值,而不是“多收录一页是一页”。反过来,如果分页页只是机械复制,留在索引之外同样不会损失什么。

可以观察的指标

调整之后不要只盯着分页本身,重点看两件事:一是详情页的抓取数量,以及“已发现、尚未编入索引”的比例有没有变化;二是日志里爬取请求的分布,是否从大量翻页地址转向了详情地址。这两个方向变好,说明路径梳理起了作用。指标暂时没变化也不必急着下结论,抓取和索引的反馈本来就有延迟。

分页本身不是问题,把分页当成着陆页,或者把着陆页当成分页,才是问题的开始。