站点运营

站点运营:分頁與無限滚動自查,別让蜘蛛只看到第一頁

栏目内容變多之後,分頁就成了蜘蛛進入深层内容的通道。本文梳理數字分頁、上一頁下一頁、加载更多與無限滚動這几種常见形態,並给出一份可执行的自查清單,涵盖連結可抓取性、頁碼 URL 規則、分頁頁面的 canonical 處理,以及無限滚動如何补上静態入口。

站点运营

站点运营:分頁與無限滚動自查,別让蜘蛛只看到第一頁

栏目寫到一定數量,列表就必然要分頁。用戶看到的是翻頁按钮,搜尋蜘蛛看到的是通往深层内容的入口。如果分頁處理得随意,蜘蛛往往在第一頁就停下,後面几十頁的内容再用心,也可能長期缺少被發現的路径。

分頁服務两個不同的讀者

用戶關心的是浏览体驗:翻到第几頁、能不能快速回到開头、加载會不會卡住。蜘蛛關心的是鏈路是否完整:從列表頁能不能走到第 2 頁、第 3 頁,頁碼 URL 是否稳定,返回的頁面是不是真的換了内容。两者的需求有重叠,但優先級並不一样,很多分頁問题正是為了迁就一方而牺牲了另一方。

用戶视角的连續性

頁碼要清晰,目前位置要有提示,翻頁後的滚動位置合理,從詳情頁返回列表时最好還能停在原来的位置。這些体驗细节不直接决定抓取,但會影响用戶是否愿意往深處点,間接影响頁面的真實使用情况。

蜘蛛视角的可達性

分頁連結最好寫在标准 a 标簽的 href 里,而不是靠点击事件在浏览器里临时拼接。如果翻頁完全依赖脚本,蜘蛛可能拿不到下一頁地址。另外,每一頁返回的正文應当不同,否則容易被当成重复頁面處理。

常见的三種分頁形態

  • 數字分頁:第 1、2、3 頁並列,鏈路清晰,但頁數一多就容易形成大量浅层連結,需要控制每屏展示的頁碼數量。
  • 上一頁/下一頁:结构简單,路径是一條线,适合按時間顺序排列的栏目。問题在于只能一步步走,中間頁缺少横向入口。
  • 加载更多與無限滚動:体驗流畅,但頁面 HTML 里往往只有第一批内容,後續資料靠接口返回,蜘蛛不执行脚本就看不到。

分頁自查清單

  1. 打開栏目第一頁,查看源碼中是否存在指向第 2 頁的可点击連結。
  2. 用纯文本方式或關閉脚本訪問第一頁,確認還能不能走到第二頁。
  3. 检查頁碼 URL 是否稳定,避免同一頁出現多種參數寫法。
  4. 確認每一頁的标题和描述有区分,至少不要全部一模一样。
  5. 检查分頁頁面的 canonical,通常指向自身更合适,不要全部指向第一頁。
  6. 查看分頁連結是否被 robots 規則、nofollow 或脚本誤挡,導致鏈路中途断開。
  7. 確認總頁數不會無限增長,归档類栏目尤其要留意。
  8. 抽查第 3 頁、第 10 頁的返回狀態碼,確認不是 404,也没有跳回首頁。

無限滚動需要补上静態入口

如果栏目采用無限滚動,建议同时保留一條可被抓取的路径,常见做法有几種:

  • 在頁面底部给出分頁連結,作為兜底入口。
  • 提供按時間或分類归档的列表頁,把内容按月份或标簽匯總。
  • 在站点地图中列出主要的列表頁地址,让深层内容多几個入口。
  • 對加载更多按钮使用真實的連結地址,脚本只负责拦截点击,不负责生成地址。

分頁 URL 的几個细节

頁碼參數尽量简單,例如固定使用 page 一個參數,不要混用 p、pg、start 等多種寫法。排序參數、篩選參數如果和分頁叠加,容易产生大量组合地址,這類頁面更适合用 robots 規則或 nofollow 控制,而不是让它們全部進入抓取队列。

還要注意分頁與终端的關系:部分站点在手机上用加载更多,在桌面端用數字分頁,两個版本的連結结构最好保持一致,避免蜘蛛只在其中一個版本里能找到深层入口。

分頁不是内容本身,而是通往内容的桥。桥断了,内容再扎實也走不進去。

小结

分頁自查不需要复杂工具,打開源碼看連結、關掉脚本看鏈路、抽查几頁看狀態碼,基本就能發現大部分問题。把分頁当成站点结构的一部分来規划,蜘蛛的抓取路径會顺畅一些,用戶翻找舊内容时也少几分阻碍。