内容量較大的站点,深层頁面的入口大多依赖列表分頁。搜尋蜘蛛沿着頁面里的 a href 逐頁向前推進,只要某一頁之後翻頁連結不再延續,後面几頁的 URL 就基本失去了被發現的机會。這類問题不會报错,頁面也能正常打開,但因為入口断了,深层内容長期停留在“存在但未被發現”的狀態。
分頁為什么容易成為入口瓶颈
抓取资源有限,蜘蛛更倾向于沿着稳定、可预测的鏈路推進。分頁恰好是這種鏈路:结构規整、层級清晰、可重复訪問。問题往往不是“完全没有連結”,而是連結在某一頁之後不再延續,或者延續的方式無法被解析。尤其是内容靠分頁承载的列表,翻頁鏈路比 Sitemap 更能反映内容的真實层級。
常见的分頁断裂形態
- 只渲染“上一頁 / 下一頁”,且在中間頁缺失“下一頁”的 a href 标簽。
- 頁碼只輸出前若干頁,後續頁碼依赖前端点击或滚動加载,源碼里没有可跟随的連結。
- 篩選或排序參數變化後,分頁連結回落到第一頁,形成原地打轉。
- 頁碼連結指向同一個 URL,或用 # 锚点代替真實地址。
- 後端人為設定了分頁上限,超過部分内容不再輸出任何入口。
- 分頁 URL 被 robots.txt、X-Robots-Tag 或 robots meta 一並屏蔽。
排查顺序
- 從栏目首頁出發,沿翻頁連結逐頁跟進,记錄在第几頁中断,以及中断頁的 URL 形態。
- 查看中断頁的源代碼,確認下一頁連結是否存在、是否為可解析的 a href,而不是按钮或事件绑定。
- 核對分頁總數與實际内容總量是否一致,確認是否被人為截断。
- 检查分頁 URL 是否被 robots.txt、响應头或頁面 meta 屏蔽。
- 检查分頁連結是否带上了會被規范化收敛的參數,導致多個入口被合並成一個。
- 確認 Sitemap 是否补足了超出分頁上限的深层列表入口。
修复與加固
- 保留可点击的分頁结构,至少包含上一頁、下一頁和若干關键頁碼。
- 分頁上限要能覆盖全部内容,或者用 Sitemap 分区把余下入口补齐。
- 如果使用無限滚動,同时保留分頁 URL 並配合歷史记錄接口,确保每個位置都有獨立地址。
- 篩選類參數组合尽量收敛,避免生成大量低價值分頁稀释抓取。
- 為深层列表保留静態入口,例如按時間归档、分類總览或标簽頁。
驗證方式
观察服務器日誌中抓取請求的路径深度分布,看是否長期集中在少數几頁;再對比分頁 URL 的實际訪問覆盖與内容總量。如果深层列表的抓取量長期偏低,通常說明翻頁鏈路在某處断了,而不是内容本身不值得抓取。
分頁入口的價值在于让蜘蛛可预期地推進,而不是把所有頁面都塞進首頁。保持翻頁鏈路完整、地址可跟随,比堆砌入口連結更有效。