入口頁要放的目标 URL 一多,分頁几乎是自然選擇。但很多人把連結铺到第十頁、第二十頁,搜尋蜘蛛却只抓了前两三頁,後面再也没動静。要判断是分頁本身有問题,還是入口頁整体质量不够,先把几個基础点拆開看。
分頁連結必须能被正常發現和点击
搜尋蜘蛛翻頁的第一步,是能找到下一頁的連結。分頁導航如果被做成纯 JavaScript 事件、图片按钮或需要点击才加载,蜘蛛很可能看不到下一頁。更稳妥的做法是使用普通的 a 标簽,href 指向可訪問的分頁 URL。連結文字可以用“下一頁”“第 2 頁”這類明确表述,不要只放一個没有文本的图标。
分頁 URL 本身也要返回正常狀態碼。如果第二頁開始返回 403、404 或跳回首頁,蜘蛛即使拿到連結,也不會繼續深入。
每頁放多少連結會影响翻頁节奏
分頁不是越多越好。每頁連結數量太密,單頁体积變大、响應變慢,蜘蛛可能来不及抓完就降低频率;每頁只有一两條,又需要翻很多頁才能触達目标,對入口頁的抓取深度要求更高。常见做法是让每頁保持在几十條以内,並保證頁面主体内容能快速返回。
- 每頁連結數量保持相對稳定,不要一頁几百條、下一頁只有几條;
- 優先把更重要的目标 URL 放在前几頁,不要預設蜘蛛會翻到最後一頁;
- 分頁數量多时,配合 sitemap 提交部分深层 URL,不要只依赖分頁導航。
頁面差异和排序方式决定蜘蛛是否值得翻
如果每一頁除了連結列表外几乎没有区別,蜘蛛可能把後續分頁视為重复内容,翻頁意愿自然下降。分頁頁面的标题、描述可以略有区分,但不要為了差异而堆砌無關文本。連結顺序也尽量稳定,避免每次訪問都随机打乱,否則蜘蛛每次回訪都像看到新頁面,反而增加無效抓取。
分頁的核心不是“多”,而是让搜尋蜘蛛用較低成本找到下一批可抓取的 URL。
rel=next/prev 和無限滚動怎么處理
rel=next/prev 早已不是搜尋蜘蛛唯一依赖的翻頁信号,不能只寫了标簽就認為分頁會被跟進。更重要的是頁面里存在可点击、可解析的分頁連結。無限滚動可以让用戶浏览更顺,但蜘蛛通常不會主動滚動,最好保留传统分頁入口作為兜底,或者在 HTML 中輸出可抓取的下一頁連結。
用日誌判断蜘蛛翻頁停在哪里
想知道搜尋蜘蛛翻到第几頁,最直接的是看服務器日誌:按分頁參數或路径分组,观察它請求了哪些頁碼、狀態碼是什么、两次翻頁之間隔了多久。如果長期只出現第一頁,先检查分頁連結是否可抓取;如果前几頁有請求但後續没有,再看响應速度、頁面体积和每頁連結數量。若日誌里出現大量 5xx,先修稳定性,再谈翻頁深度。
分頁之外還需要注意什么
分頁只是發現路径之一。入口頁本身如果長期没有更新、没有外部連結指向、或者整体抓取频次在下降,分頁做得再規范,搜尋蜘蛛也未必會持續翻。可以把分頁連結、sitemap、少量站内入口结合起来,並定期看日誌里目标 URL 是否真正被請求,而不是只看入口頁有没有被抓。
最後提醒一句:搜尋蜘蛛翻不翻頁、翻到第几頁,没有固定答案,也不存在寫完分頁連結就保證收錄的做法。把可抓取、响應稳定、頁面有区分度這几件事做好,剩下的交给日誌去驗證。