網站收錄

分頁列表頁的收錄取舍:哪些頁碼保留,哪些可以收敛

分頁列表頁翻出的每一頁都是獨立 URL,容易占用抓取、堆积近重复内容。本文区分带獨立内容的分頁、纯導航翻頁與深頁碼,给出保留前几頁、用 noindex 收敛深頁碼、补齐詳情頁入口的處理顺序,並說明為什么不建议把分頁 canonical 全部指向第一頁。

網站收錄

分頁列表頁的收錄取舍:哪些頁碼保留,哪些可以收敛

分頁頁面本质上是同一批内容的多次切片

分類列表、文章归档、商品列表,翻頁後生成的每一頁都是獨立 URL。對爬虫来说,?page=2 和列表第一頁是两個不同的地址,不會被自動合並。一個 20 頁的分類,就等于给站点多加了 19 個頁面;分類一多,這類 URL 很容易堆到几千條。它們會消耗抓取配額,也可能進入索引,最後表現為索引里一堆标题相似、内容大多是同几篇文章摘要的頁面。

先分清三類分頁,再决定怎么處理

1. 带獨立内容的分頁

比如按價格、销量排序的列表,或每頁有獨立摘要、獨立篩選维度的頁面。這類頁面可能有自己的搜尋需求,可以考虑保留索引,但要注意排序參數不要無限组合。

2. 纯導航性质的翻頁

第二頁到最後一頁,主要作用是让用戶和爬虫繼續往下走。它們几乎没有獨立搜尋價值,也不值得長期留在索引里。

3. 深頁碼

翻到十几頁之後,通常已经是舊内容或長尾條目。用戶很少進入,爬虫也不该反复来。

推荐的收敛顺序

  1. 前几頁保留可索引。第一頁保留索引是常识;如果第二、三頁有真實点击和轉化,也可以保留。
  2. 深頁碼用 noindex 處理,而不是 robots.txt。robots.txt 屏蔽之後爬虫不再抓取這些 URL,頁面上指向詳情頁的連結也就看不到了,等于自己切断了發現路径。noindex 只是不進索引,連結仍有机會被跟踪。
  3. 把詳情頁的入口搬到稳定位置。更可靠的做法是让詳情頁出現在分類第一頁、站点地图和相關推荐模块里,不依赖深頁碼传递連結。
  4. 無限滚動要留一條可抓取的路径。纯 JS 加载的列表,如果没有任何分頁 URL,首屏之外的條目對爬虫等于不存在。
需要留意的是:把所有分頁的 canonical 都指向第一頁,並不是通用解法。規范标簽表達的是“這是同一頁面的不同版本”,而第三頁並不是第一頁的副本,指向第一頁可能让整组分頁的抓取都停下来。

如何判断處理得對不對

過一两周,用站点查询看分頁 URL 的索引數量有没有下降;同时去看抓取統計,確認深頁碼的抓取次數明顯减少,而詳情頁的抓取没有被顺带砍掉。關键指标不是分頁被收錄多少,而是詳情頁是否照常被抓取和收錄。如果分頁收敛後詳情頁收錄反而變慢,說明發現路径依赖得太深,需要补内鏈或站点地图。

两個容易忽略的细节

  • 分頁 URL 形式保持统一。同一组列表同时存在 ?page=2、/page/2/、?paged=2 三種寫法,只會让問题翻倍。
  • 排序、篩選參數如果可任意组合,先限制组合數量,再谈收不收錄。參數组合生成的是成百上千個近重复頁面,靠 noindex 一條條堵會很累。

分頁的處理目标不是“让更多頁面被收錄”,而是让爬虫把有限的抓取用在真正需要索引的詳情頁上。分頁本身只是通道,通道不需要全部進索引。