網站收錄

分頁列表的後半段要不要收錄:從抓取路径到索引膨胀的取舍

分頁頁被抓取不等于要進索引。文章按頁面角色、点击深度、内容重复度三個角度判断哪些分頁 URL 值得保留,哪些适合保留抓取、去掉索引,並說明為什么不该直接用 robots 一刀切。

網站收錄

分頁列表的後半段要不要收錄:從抓取路径到索引膨胀的取舍

先分清:分頁頁被抓取,和進入索引是两件事

日誌里频繁出現 /list/page/12 這類地址,只能說明搜尋引擎在爬它。是否收進索引,取决于這個 URL 有没有獨立價值。很多人一看到“分頁被抓取”就紧張,其實抓取本身是正常的,它是爬虫顺着内鏈往下走、發現新内容的過程。真正需要判断的是:這批 URL 值不值得占一個索引位置。

第一步:给每個分頁 URL 定角色

同样是分頁,承担的任務差別很大。先按用途分组,再谈取舍:

  • 導航型:用戶要翻着看,第二、三頁有明确的浏览需求,通常可以正常抓取。
  • 深度翻頁:第 20 頁之後的列表,极少有人主動搜到,收錄價值有限。
  • 聚合型:按标簽或條件组合生成的列表,可能和主分類頁内容高度重合。
  • 發現通道:新詳情頁往往是通過列表頁的内鏈首次被發現的,這類路径不能掐断。

第二步:看点击深度,別把發現路径一起關掉

分頁 URL 常常是深鏈入口。如果詳情頁只能從分頁列表点進去,那么分頁被屏蔽,等于把發現路径也一並關上了。

為什么不要用 robots.txt 一刀切屏蔽分頁目錄

robots 屏蔽的结果是“不再抓取”。爬虫看不到頁面内容,也看不到頁面上的連結,深层詳情頁就更难被發現。用 noindex 處理則不同:頁面仍可被抓取,連結仍可被跟進,只是不進入索引。想收敛索引,優先考虑 noindex,而不是直接封路。

第三步:判断重复度,再决定留不留

如果分頁頁只展示标题加摘要,而詳情頁已经被收錄,這些分頁大多不提供額外信息,索引價值偏低。反過来,如果分頁頁里带了一段獨特的匯總說明、價格区間或統計信息,它就不算纯重复,可以保留。

收敛方式的選擇顺序

  1. 保留索引:前几頁有真實浏览和检索需求,内容不重复,保持現状即可。
  2. 保留抓取 + noindex:深度翻頁、條件组合頁、纯列表頁,最常见的選擇。
  3. 谨慎使用 canonical:把後續分頁指向第一頁,會让各頁獨有的條目失去被抓取的意义,容易拖慢新内容的發現,只在内容确實重复时使用。
  4. 合並或收敛 URL:把篩選參數收進規范形式,减少同一列表派生出的多套地址。
  5. 最後才考虑 robots:只有在明确既不需要發現、也不需要索引时才用。
需要留意:加了 noindex 的頁面依然會被抓取,量大的时候同样占用抓取预算。如果几千個分頁都挂上 noindex,效果可能不如從源头减少可翻頁的數量。

用日誌核對:分頁有没有吃掉抓取预算

  • 統計日誌里分頁 URL 占總抓取的比例,如果超過一半就值得留意。
  • 對比新發布頁面的收錄速度,明顯變慢时,先怀疑深度分頁在消耗预算。
  • 检查“加载更多”:如果它不生成真實 URL,里面的内容就不會被單獨發現;需要收錄就给一個可訪問地址。

調整节奏:小范围先试

不要一次性给整站分頁加 noindex。可以先把最深的几层處理掉,观察一到两個抓取周期:新頁面被發現的速度有没有變化、索引里多余的分頁是否减少。方向確認後再逐步扩大范围,比一次性大改更容易回退,也更容易判断到底是哪一步起了作用。