網站收錄

分頁頁面的收錄取舍:第几頁開始收敛,怎么判断

分頁 URL 要不要收錄,没有统一答案。本文從分頁的两種形態入手,說明放開與收敛各自的代價,给出可执行的自查顺序和常见處理方式,並列出三個容易踩的坑,帮你判断第二頁之後该保留、该收敛還是该只留抓取。

網站收錄

分頁頁面的收錄取舍:第几頁開始收敛,怎么判断

列表頁翻到第二頁、第三頁,這些 URL 到底要不要被搜尋引擎收錄?這個問题没有统一答案,因為它同时牵扯两件事:一是更靠後的内容能不能被蜘蛛發現,二是抓取和索引资源會不會被大量相似頁面稀释。先判断頁面本身的差异,再决定放開還是收敛,比套用某個固定做法更稳妥。

先分清分頁的两種形態

一種是传统分頁,URL 明确變化,比如 /list?page=2 或者 /list/page/2;另一種是“加载更多”或無限滚動,地址栏不變,内容靠 JS 追加。两者的處理逻辑完全不同。

  • 獨立 URL 的分頁:每個頁碼都是一個可訪問的地址,蜘蛛可以單獨抓取,也存在被單獨收錄的可能。
  • 無獨立 URL 的加载更多:通常只有一個頁面地址,後面内容在初始 HTML 里可能並不存在,需要確認渲染後正文是否能被拿到。

如果是第二種,重点應该放在“深层内容有没有別的入口”上,而不是讨论頁碼收錄。

分頁 URL 的價值和代價

放開收錄的理由很简單:列表頁本身是一個强内鏈聚合,能把深层的詳情頁更集中地送到蜘蛛面前。当一個栏目的詳情頁很难通過其他路径被發現时,分頁往往是有效的补充入口。

代價也很明顯:第 N 頁的正文主体基本相同,只有條目列表不同,容易被判為高度相似;頁數越多,這種低差异 URL 的占比越高,抓取频率就會被摊薄。很多站点的問题不是“分頁没收錄”,而是“分頁收了一大堆,詳情頁反而抓得少”。

一個可执行的自查顺序

  1. 確認分頁上的條目,是否都能通過其他内鏈路径到達。能到達,分頁的收錄價值就低很多。
  2. 看分頁 URL 是否被大量參數污染(排序、篩選、追踪參數叠加),先做規范化。
  3. 看第 2 頁以後的内容量,如果每頁只有五六條摘要,内容稀薄,收敛更合适。
  4. 最後才决定處理方式,並观察一段時間索引與抓取日誌的變化,不要频繁来回改。

几種常见處理方式

  • 自引用 canonical:每頁指向自己,配合正常的翻頁内鏈,属于預設放開,适合詳情頁依赖分頁發現内容的站点。
  • canonical 指向第一頁:把第二頁之後都归到列表首頁。這样做會让後面的 URL 逐渐登出索引,但如果第一頁並不包含後面的條目,用戶從搜尋结果進入时体驗會不一致。
  • noindex, follow:頁面不參與索引,但連結仍被跟踪。這是比較常用的折中方案,既保留發現路径,又减少相似頁面占用索引。
  • robots.txt 屏蔽抓取:不建议用在分頁上。它阻止的是抓取本身,蜘蛛讀不到 noindex,一旦已经被收錄,反而可能長期留在索引里。
一個常见的矛盾:想用分頁帮詳情頁被發現,又不想让分頁自己占索引。noindex, follow 正是為這種需求准备的,但它要求頁面仍能被正常抓取。

容易踩的三個坑

  • 把 ?page=1 和列表首頁当成两個頁面,内容一样却各留一個地址,重复度凭空增加。
  • 分頁連結用 JS 点击渲染,初始 HTML 里没有可爬的 a 标簽,後面的内容就成了事實上的孤儿。
  • 發現分頁被收錄後立刻整站 noindex,把原本有效的發現路径一起砍掉,深层頁面抓取量反而下降。

观察指标不要只看一個數

改完之後至少盯三样東西:分頁 URL 在索引里的數量、栏目詳情頁的收錄比例、以及蜘蛛對该目錄的抓取频次。如果分頁數量降了,但詳情頁收錄没有受影响,說明收敛方向是對的;如果詳情頁收錄一起掉了,說明被砍掉的是主要發現通道,需要把抓取放回来。

结论可以很简單:如果詳情頁有稳定的内鏈路径,分頁倾向收敛;如果分頁是發現深层内容的主要通道,就保留抓取但控制索引。無论選哪種,改完都要留出观察周期,把索引量、抓取频次和詳情頁的收錄情况放在一起看,而不是只盯分頁 URL 的數量。