分页是列表型栏目绕不开的结构。文章列表、商品列表、标签聚合页,只要内容量上来,就会自然分出第 2 页、第 3 页。对用户来说,分页只是浏览方式;对搜索蜘蛛来说,分页却是一组需要判断的 URL。如果分页逻辑没处理好,蜘蛛可能在翻页上消耗大量抓取配额,也可能错过列表深处的内容。
分页为什么值得单独自查
蜘蛛发现新 URL 的路径,很大一部分来自列表页和分页。它顺着第一页找到第二页,再找到第三页,理论上可以一路爬下去。问题在于,站内分页一旦出现参数混乱、链接依赖 JavaScript、或者每页内容高度重复,蜘蛛就容易在同一个列表里来回绕。更常见的情况是,分页链接虽然存在,但只是按钮,没有可抓取的 a 标签,蜘蛛只能抓到第一页。
另一个误区是把所有分页都设成 noindex。分页不是低质页面,它是通往详情页的通道。如果把分页全部屏蔽,蜘蛛仍然可以通过第一页找到部分文章,但较深的内容就需要更多轮抓取才能发现。对更新频繁的站点来说,这会让新内容进入索引的速度变得不稳定。
先分清三种常见分页形态
传统翻页
每页有独立的 URL,页面底部或顶部有上一页、下一页、页码链接。这种形式对蜘蛛最友好,关键是保持链接可抓取,并让页码 URL 稳定,不要今天用 /page/2,明天用 ?paged=2。
加载更多
点击按钮后追加内容。如果按钮只是 JavaScript 事件,没有对应 URL,蜘蛛无法通过它继续往下。可以保留一个可抓取的“下一页”链接,或者为加载更多提供独立 URL。
无限滚动
用户滚动时自动加载。体验顺滑,但蜘蛛通常不会滚动页面。需要给无限滚动配上分页 URL,或者至少在第一屏提供足够多的可抓取链接,并在页面中放置指向后续页面的链接。
分页自查清单
- 翻页链接是否使用普通 a 标签,而不是 onclick 或纯按钮?
- 第二页及之后的页面,标题和描述是否只是机械重复第一页?
- 分页 URL 是否统一,有没有参数和路径混用?
- 分页页面是否被误设成 noindex 或 robots.txt 屏蔽?
- 分页页面上的 canonical 是否指向自己,而不是全部指向第一页?
- 列表内容是否随页码更新,还是每一页都展示同一批内容?
- 空分页、超出范围的页码是否返回 404 或 410,而不是 200 空列表?
几个容易踩坑的处理方式
把分页 canonical 全部指向第一页是常见错误。这样等于告诉搜索引擎后续页面不是独立页面,蜘蛛可能减少对它们的抓取,列表深处的文章也更难被发现。分页页面可以自指 canonical,或者不写 canonical,让搜索引擎自行判断。
用 robots.txt 屏蔽分页参数也要谨慎。如果被屏蔽的 URL 正好是蜘蛛进入详情页的唯一路径,就会切断发现链路。更好的做法是保留可抓取的分页,把真正无价值的筛选组合参数页单独处理。
分页标题完全一样并不致命,但可以在标题里自然加入页码或该页的特征,例如“第 2 页”。不要为了关键词堆砌而强行改写,保持可读即可。
观察蜘蛛在分页上的行为
可以结合抓取日志看几件事:蜘蛛是否访问到第 3 页、第 5 页,还是只停在第一页;分页 URL 是否出现大量重复抓取;参数组合是否产生蜘蛛陷阱。如果发现某个列表页每天被反复抓取,但详情页更新很少,就要检查分页链接是否让蜘蛛进入了循环。
分页不是为了让蜘蛛无限翻页,而是为了让重要内容有一条清晰、稳定、可抓取的发现路径。能翻到,比翻得深更重要。
小结
分页自查不需要复杂工具。打开栏目第一页,禁用 JavaScript,看看还能不能顺着链接走到第二页、第三页;再看看分页 URL 是否稳定、是否被误屏蔽、canonical 是否合理。把这几件事理顺,蜘蛛在列表页里的抓取会更有效率,新内容也更容易被带到该去的位置。