很多站点运营者盯首页、盯栏目页、盯 Sitemap,却很少检查列表页的分页。实际上,对内容型站点来说,蜘蛛能持续发现半年前、一年前的老文章,主要靠的就是列表页一页页往下翻。分页链路断了,新内容照常被抓,但存量 URL 会慢慢从抓取队列里消失,日志里表现为老页面的抓取频次一路下滑。
列表页承担了大部分 URL 发现工作
Sitemap 提供的是候选清单,内链提供的是路径。蜘蛛顺着首页进入栏目,再顺着栏目列表进入详情页,这条链路是它最熟悉、也最愿意反复走的。分页链接是这条链路的延长线:第一页之后的内容,往往只能通过它继续被发现。
所以判断一个站点的抓取是否健康,可以先看两件事:列表页上的详情链接是不是纯 HTML 可读;分页链接能不能在不做任何交互的情况下被读到。
分页写法的几种常见问题
只在点击后才出现的分页
移动端常见的「加载更多」或无限滚动,初始 HTML 里往往没有任何下一页链接。蜘蛛不会去点按钮,也就走不到第二页往后。可行做法是保留一个静态的分页链接,或者至少给出进入更深层列表的入口,让不执行 JS 的抓取也能继续往下走。
分页被 robots.txt 或频控挡住
有些站点为了避免重复内容,直接在 robots.txt 里屏蔽带 page 参数的地址。结果是详情页本身还能从别处被发现,但沿着分页往下走的路径被切断了。屏蔽前最好先确认一件事:这条 Disallow 挡掉的只是分页页,还是连带挡掉了筛选页、标签页里的详情链接。
分页页被 noindex 或 canonical 指回第一页
分页页不参与索引通常没问题,它本来就不是用来排名的。但要注意区分「不索引」和「不抓取」:noindex 的页面蜘蛛仍会来抓,分页链接依然可以通行。真正有影响的是把分页做成需要交互才能进入,或者让翻页地址根本不出现在任何 HTML 里。canonical 指回第一页时,重点看它是否同时把链接也一起改掉了。
分页本身也会消耗抓取资源
如果一个列表页动辄列出上百条,每页还要加载大量图片和脚本,蜘蛛单位时间能走完的分页数就会下降,深层的存量内容自然排到后面。列表页保持轻一点,把详细信息留给详情页,对抓取效率更友好。翻页数量也不要人为收得太紧,「一共两百页却只放出十页」会让后面的内容彻底失去入口。
一份可以照着做的自查清单
- 禁用 JS 后打开列表页,确认分页链接仍然存在且可点击。
- 用抓取日志核对:第二页之后的 URL 是否还有蜘蛛访问记录。
- 检查 robots.txt,确认没有把翻页参数整体屏蔽。
- 确认分页链接带的是可读 URL,而不是 onclick 事件或空 href。
- 控制列表页首屏 HTML 体积,减少不必要的内联脚本。
- 老内容如果只剩 Sitemap 一个入口,考虑在相关推荐、标签页里补上内链。
分页不是给人看的装饰,它是蜘蛛进入存量内容的楼梯。楼梯断在哪里,抓取就停在哪里。
分页链路的问题通常不会立刻显现,它更像慢性失血:首页和最新文章一切正常,只有翻日志才会发现老 URL 的抓取越来越少。定期检查一遍从列表页到深层页的路径,比事后追着抓取异常找原因要省力得多。