站点运营

站点运营:分頁列表自查,把翻頁路径交代清楚

列表頁的分頁往往是網址最容易膨胀的地方:翻頁參數没有上限、篩選條件自由组合、每個分頁标题雷同,都會让蜘蛛把抓取時間耗在很靠後的頁面上。這篇文章梳理分頁地址的收敛方式、标记寫法、翻頁深度控制和一套可执行的自查步骤,帮助你把列表頁的抓取路径理顺。

站点运营

站点运营:分頁列表自查,把翻頁路径交代清楚

列表頁和分頁看起来只是翻頁功能,對蜘蛛却是一個不断向外扩散的入口。一篇文章只有一個網址,而一個列表頁可能带出几十個分頁地址,每個分頁又各自带出更多連結。這部分没设計好,站点很容易出現三類問题:分頁地址無限增長、同一批内容對應多個網址、蜘蛛把時間花在翻到很後面的頁面上。

分頁常见的几個問题

  • 翻頁參數没有上限,page 後面跟到几千也没人管;
  • 篩選項、排序方式、時間范围與分頁參數自由组合,生成大量内容几乎相同的頁面;
  • 每個分頁的 title 和 description 完全一样,用戶和蜘蛛都看不出区別;
  • 列表里只有摘要甚至只有图片,点進去的正文反而被稀释;
  • 移動端用加载更多按钮,蜘蛛根本点不出後面几頁。

先把分頁地址收敛住

能用路径就別堆參數

技術條件允许时,分頁寫成 /list/2/ 這類可讀路径,比带一串參數的地址更清楚,後續做規范化也省事。參數越少,處理重复内容时越不容易出错。

參數分頁要设邊界

排序和篩選属于交互功能,可以保留參數,但要限制能被抓取的组合數量。比如只让按時間、按热度两種排序進入索引,其余组合要么加 noindex,要么在 robots 里屏蔽。否則一年下来,光是篩選组合就能堆出上萬條地址。

给翻頁深度设上限

翻到第五十頁,對用戶和蜘蛛都没什么意义。後台可以直接设定一個上限,超過上限的請求返回 404 或跳回列表第一頁,避免參數被人為拼接到任意數值。

分頁上的标记怎么寫

  • canonical 指向分頁自身,不要全部指向列表首頁;
  • rel next 和 prev 早已不是收錄依據,但保留清晰的翻頁連結仍然有價值;
  • title 里可以带上第 N 頁,但別為了差异化硬塞關鍵詞;
  • 列表摘要保留文章開头的真實内容,不要用统一模板套话。

翻頁深度與抓取预算

每個分頁都會带出新的連結,列表每頁放多少條、能翻多少頁,直接影响蜘蛛在站内的行走路线。建议把每頁條數控制在二十到五十條之間,把最新、最重要的内容放在靠前的分頁,舊内容自然下沉。如果某個栏目内容量很大,可以用分類或時間归档把它拆成多個入口,而不是让蜘蛛沿着一條分頁鏈一直往後翻。

自查步骤

  1. 打開一個列表頁,把所有翻頁連結依次点開,观察地址如何變化,有没有出現多层參數叠加;
  2. 確認同一篇文章是否能通過多個分頁地址進入,重复的部分是否做了處理;
  3. 在站長平台或日誌里看分頁地址的抓取频率,是否明顯高于内容頁;
  4. 检查加载更多和無限滚動,確認不依赖点击也能拿到後續内容;
  5. 核對分頁的标题、描述和 canonical 是否符合预期。

無限滚動與 JS 分頁

無限滚動体驗不错,但纯前端實現往往只在用戶滚動时才請求資料,蜘蛛看到的可能始终是第一批内容。常见的做法是给無限滚動配一套可訪問的分頁地址,滚動加载的同时把翻頁連結保留在頁面里,让两種方式指向同一批内容。

分頁不是功能细节,它决定了蜘蛛從一個入口能走到多遠。把地址收敛、标记寫清、深度控制住,列表頁才不會變成抓取的無底洞。