站内的列表页、分类页和翻页,是蜘蛛发现新内容最主要的通道之一。一个栏目往下翻二十页,就多出二十个 URL;资讯、电商、论坛类站点很容易在不知不觉中把索引撑大。问题不在于要不要有列表页,而在于哪些翻页 URL 值得留在索引里。
列表页和翻页各自承担什么角色
列表第一页通常同时是导航入口和内容摘要,有独立标题、相对稳定的内容,多数情况下值得收录。第 2 页及以后,内容主体往往是同一批条目的重新排序,页面价值明显下降,但它仍然是蜘蛛往深处爬的路径。所以抓取和收录要分开看:可以让蜘蛛爬,不代表一定要让它进索引。
值得留在索引里的翻页
- 页面本身有可读内容,例如带摘要、带筛选说明,而不是只有标题列表;
- 该页是站内少数几条通向深层内容的路径,去掉之后部分页面会变成孤岛;
- URL 稳定、参数简洁,内容不随访问者身份变化。
不值得留在索引里的翻页
- 由排序、筛选参数组合出来的近似页,同一批商品换一种顺序就是一个新 URL;
- 内容基本是标题堆叠,用户落地后还得再点一次才能看到正文;
- 由加载更多动态拼接出来、本身没有独立入口的页面。
常见分页形态怎么处理
传统 ?page=2 式翻页
保持可抓取,让蜘蛛能顺着链接继续往下走。同时判断这批 URL 是否值得单独收录:如果页面内容高度重复,可以用 canonical 指向序列中的规范形态,或对靠后的页码使用 noindex,把抓取和索引的意图分开表达。
无限滚动和加载更多
滚动加载的内容在初始 HTML 里往往没有对应链接,不执行脚本的抓取就到此为止。建议保留一份可点击的分页链接作为兜底,让抓取能沿着真实链接往下走,而不是依赖脚本触发。
view-all 合并页
把多页内容合并成一页,理论上能减少重复 URL,但内容量一大,页面会变得很长、加载变慢,用户和抓取都未必受益。条目数量可控时可以用,量大时更适合保留分页结构。
先用数据自查,再决定改什么
- 看日志或后台数据里蜘蛛的抓取分布,估算翻页占用了多少抓取量;
- 抽查若干翻页 URL 的收录情况和落地内容,判断是重复还是各有用途;
- 区分是抓取浪费还是索引膨胀,两者处理方式不同,不要一起动手;
- 改动后观察一到两个抓取周期,再决定是否加第二步调整。
翻页是否被收录,最终是搜索引擎自己做的取舍。你能做的是把信号说清楚:哪些页是内容页,哪些只是通往内容页的路径。
分页没有统一答案。同一站点里,栏目翻页和筛选翻页的处理方式也可以不同。关键是别让近似页面互相竞争,也别为了省索引而把蜘蛛挡在通往深层内容的路上。