列表頁、归档頁、标簽頁通常都有分頁。它們看起来只是把内容切成了几段,但在蜘蛛眼里,分頁是通往舊内容的路径。如果翻頁只做给訪客看,蜘蛛跟不進去,後面的内容就容易被留在抓取范围之外。
分頁為什么容易被忽略
常见的情况有几種:翻頁按钮用 JavaScript 渲染,頁面源碼里没有可点击連結;分頁 URL 參數杂乱,同一頁出現多個地址;把所有分頁的 canonical 都指向第一頁;或者為了避免重复内容,干脆给分頁加了 noindex。這些做法單獨看都有理由,合在一起却可能让蜘蛛只抓到第一頁。
翻頁導航的几種寫法與取舍
传统連結翻頁
上一頁、下一頁、頁碼數字都用 a 标簽指向獨立 URL,這是最容易被抓取的形式。只要 URL 稳定、連結在源碼里存在,蜘蛛就能顺着翻到後面几頁。頁面數量多时,不必每一頁都放完整頁碼,保留上一頁、下一頁和首尾頁入口即可。
無限滚動與“加载更多”
無限滚動和按钮加载更多對訪客友好,但新增内容如果没有對應 URL,蜘蛛很难触發。可以保留一套普通分頁地址作為补充,或者在頁面源碼里放入指向後續分頁的連結。不要只依赖滚動事件,因為蜘蛛通常不會滚動頁面。
下拉選擇或表單跳轉
用下拉框選擇頁碼再跳轉,属于表單操作,不是連結。蜘蛛一般不會主動提交表單,因此這類跳轉對抓取帮助有限。如果必须保留,可以在旁邊补一组普通的翻頁連結。
URL 與規范化:別把翻頁地址搞乱
分頁 URL 常见的寫法有两種:?page=2 這样的參數形式,以及 /page/2/ 這样的路径形式。两種都可以,關键是保持统一,不要同一個列表同时存在多套翻頁規則。分頁頁面的 canonical 一般指向自身,而不是第一頁。把所有分頁都 canonical 到第一頁,等于告诉搜尋引擎後面几頁不是獨立頁面,舊内容可能因此失去入口。
如果分頁内容确實只是摘要和重复列表,可以考虑保留抓取但做好内容区分,比如给每頁寫獨立的标题和描述。直接 noindex 所有分頁是一種省事做法,但也會切断通往舊文章的路径,需要確認站点地图或其他内鏈能补上入口。
分頁不是重复内容的必然来源。真正的問题是分頁頁之間缺少区分,以及翻頁路径没有被蜘蛛發現。
抓取路径自查清單
- 翻頁連結是否寫在 HTML 源碼里,而不是只在 JavaScript 执行後才出現。
- 每一頁是否有稳定、可訪問的 URL,參數或路径形式是否统一。
- 分頁 canonical 是否指向自身,有没有全部指向第一頁。
- robots.txt 或 noindex 有没有誤伤分頁地址。
- 站点地图是否包含重要的列表頁和分頁入口。
- 頁面标题是否每頁都一样,能否加入頁碼或范围做区分。
- 服務器日誌里,分頁地址的抓取频率是否明顯低于第一頁。
内容更新後分頁怎么處理
列表頁第一頁通常放最新内容,随着更新,舊内容會往後移。URL 不變的情况下,蜘蛛需要重新抓取第一頁和後續頁面,才能發現新内容。如果站点更新频繁,可以适当提高列表頁的抓取频率,但不必為了分頁专门制造大量地址。重点是让翻頁路径保持通畅,让蜘蛛每次来都能顺着連結往下走。
分頁设計不需要复杂,稳定和可抓取比花哨更重要。把翻頁連結、URL 規則和規范化處理清楚,舊内容才有机會被持續發現。