内容量较大的站点,深层页面的入口大多依赖列表分页。搜索蜘蛛沿着页面里的 a href 逐页向前推进,只要某一页之后翻页链接不再延续,后面几页的 URL 就基本失去了被发现的机会。这类问题不会报错,页面也能正常打开,但因为入口断了,深层内容长期停留在“存在但未被发现”的状态。
分页为什么容易成为入口瓶颈
抓取资源有限,蜘蛛更倾向于沿着稳定、可预测的链路推进。分页恰好是这种链路:结构规整、层级清晰、可重复访问。问题往往不是“完全没有链接”,而是链接在某一页之后不再延续,或者延续的方式无法被解析。尤其是内容靠分页承载的列表,翻页链路比 Sitemap 更能反映内容的真实层级。
常见的分页断裂形态
- 只渲染“上一页 / 下一页”,且在中间页缺失“下一页”的 a href 标签。
- 页码只输出前若干页,后续页码依赖前端点击或滚动加载,源码里没有可跟随的链接。
- 筛选或排序参数变化后,分页链接回落到第一页,形成原地打转。
- 页码链接指向同一个 URL,或用 # 锚点代替真实地址。
- 后端人为设置了分页上限,超过部分内容不再输出任何入口。
- 分页 URL 被 robots.txt、X-Robots-Tag 或 robots meta 一并屏蔽。
排查顺序
- 从栏目首页出发,沿翻页链接逐页跟进,记录在第几页中断,以及中断页的 URL 形态。
- 查看中断页的源代码,确认下一页链接是否存在、是否为可解析的 a href,而不是按钮或事件绑定。
- 核对分页总数与实际内容总量是否一致,确认是否被人为截断。
- 检查分页 URL 是否被 robots.txt、响应头或页面 meta 屏蔽。
- 检查分页链接是否带上了会被规范化收敛的参数,导致多个入口被合并成一个。
- 确认 Sitemap 是否补足了超出分页上限的深层列表入口。
修复与加固
- 保留可点击的分页结构,至少包含上一页、下一页和若干关键页码。
- 分页上限要能覆盖全部内容,或者用 Sitemap 分区把余下入口补齐。
- 如果使用无限滚动,同时保留分页 URL 并配合历史记录接口,确保每个位置都有独立地址。
- 筛选类参数组合尽量收敛,避免生成大量低价值分页稀释抓取。
- 为深层列表保留静态入口,例如按时间归档、分类总览或标签页。
验证方式
观察服务器日志中抓取请求的路径深度分布,看是否长期集中在少数几页;再对比分页 URL 的实际访问覆盖与内容总量。如果深层列表的抓取量长期偏低,通常说明翻页链路在某处断了,而不是内容本身不值得抓取。
分页入口的价值在于让蜘蛛可预期地推进,而不是把所有页面都塞进首页。保持翻页链路完整、地址可跟随,比堆砌入口链接更有效。