網站收錄

分頁列表的第 2 頁、第 3 頁该不该收錄:分頁序列的處理思路

分頁列表同时承担導航、内容發現和聚合三種角色,是否值得收錄要看頁面有没有獨立價值。本文梳理分頁允许收錄與僅保留抓取的两類處理方式,說明 noindex 與 canonical 的取舍、URL 寫法统一、無限滚動的替代做法,以及如何用日誌和索引資料判断目前狀態。

網站收錄

分頁列表的第 2 頁、第 3 頁该不该收錄:分頁序列的處理思路

先分清分頁承担的三種角色

分頁列表通常同时在做三件事:给用戶提供翻頁導航、给蜘蛛提供更深层内容的入口、把同類内容聚合到一起。這三種角色對“要不要被收錄”的要求並不一样。導航角色只要求頁面能被抓取、頁内連結能被跟随;聚合角色則要求内容本身有獨立價值。只有第三点成立时,才值得考虑让分頁進入索引。

什么情况下分頁值得被收錄

每一頁的内容组合确實不同

商品篩選後的列表、按時間滚動的资讯列表,每頁展示的條目不同,用戶有可能通過搜尋直接落到第 3 頁。這類頁面带有一定的獨立信息,允许被收錄是合理的。但不要把期望放得太高,搜尋引擎通常會把它們归入同一個主题簇,只挑選其中一两頁作為代表,其余分頁即使收錄也很少带来流量。

分頁是主要的内容發現路径

如果某個分類下總共只有二三十條内容,第 2 頁以後基本没有新增信息,收錄它的意义就不大。這種情况更常见的做法是保留抓取、放弃收錄,让抓取资源用在詳情頁上。

不打算被收錄时,有几種處理方式

  • noindex, follow:頁面不進索引,但頁内連結仍會被跟随,深處的内容不會因此断掉入口。這是分頁最常用的處理方式,前提是不要同时用 robots.txt 屏蔽它。
  • canonical 指向自身:每個分頁各自声明規范地址,不跟主列表頁争抢。适合内容确實不同、希望保留收錄可能的分頁。
  • canonical 指向第一頁:只在分頁内容高度雷同、几乎没有獨立信息时使用。用之前要確認頁面上没有用戶可能搜尋的獨有内容,否則等于主動放弃這一部分。
要避開的一種做法:用 robots.txt 屏蔽分頁。蜘蛛爬不到分頁,分頁里的詳情頁連結也就失去了發現路径,容易在後台留下大量“已發現但尚未抓取”的 URL。

URL 寫法要统一

同一個分頁序列,最好只保留一種地址形式。常见的分叉包括:?page=2/page/2/ 並存,第一頁既有不带參數的版本又有 ?page=1 的版本,排序、會话 ID、追踪參數被带到分頁連結上。這些都會让同一個分頁被拆成多個地址,分散抓取资源,也让規范地址的判断變得模糊。處理顺序是:先固定預設排序,再清理無意义的參數,最後统一分頁參數的位置和寫法。

rel=next / prev 還要不要寫

主流搜尋引擎已经不再把它当作索引信号,寫了不會有害,但不要指望靠它解决重复問题。真正起作用的是頁面自身的規范地址、内容差异,以及頁内連結是否可抓取。

無限滚動和“加载更多”

内容靠脚本追加、URL 始终不變的列表,蜘蛛能看到的往往只有首屏。相對稳妥的做法是同时保留可訪問的分頁 URL,即使它在頁面上不顯眼;或者保證首屏的 HTML 里就已经存在指向後續條目的連結,而不是等交互後才生成。

怎么判断分頁現在的狀態

  • 蜘蛛日誌里看分頁 URL 的抓取频次和狀態碼,長期不被訪問的分頁,通常是没有入口或被認為價值偏低。
  • 索引覆盖率類报告里,關注“已發現-尚未编入索引”的 URL 是否大量集中在分頁模板上。
  • 抽样做站内检索,看第 2 頁以後是否出現在结果里,並结合這些頁面的實际訪問量做判断。

一個可执行的推進顺序

  1. 列出全站的列表模板,確認分頁 URL 規則是否唯一。
  2. 按模板判断分頁是否存在獨立内容,分成“允许收錄”和“僅保留抓取”两批。
  3. 统一參數與寫法,去掉排序、會话、追踪带来的地址分叉。
  4. 確認從分頁到詳情頁的連結在 HTML 中可以直接抓取。
  5. 观察一段時間的抓取日誌與索引資料,再决定是否調整策略。

分頁處理的目标不是让每個分頁都進索引,而是不让重复的分頁挤占抓取资源,同时不切断内容發現路径。判断标准始终是頁面有没有獨立價值,而不是“分頁”這個形式本身。