網站收錄

列表分頁的收錄取舍:翻頁地址放行、合並還是屏蔽

分頁地址數量多、價值差异大,全部放行會挤占抓取配額,全部屏蔽又可能切断詳情頁的抓取路径。本文從内容增量、地址形態、規范與屏蔽手段几個角度,给出分頁頁面收錄取舍的判断顺序和可落地的規則。

網站收錄

列表分頁的收錄取舍:翻頁地址放行、合並還是屏蔽

列表頁翻頁是站点里數量最多、也最容易被忽略的一類地址。文章列表翻到第 30 頁、商品分類翻到第 80 頁,這些地址既不像内容頁那样有明确主题,也不像纯導航那样毫無價值,搜尋引擎對它們的處理方式差別很大。處理不当,要么让大量低價值翻頁地址挤占抓取配額,要么让本来能带来長尾流量的頁面被提前挡在索引之外。

先判断翻頁有没有獨立價值

翻頁地址值不值得被收錄,不取决于它是第几頁,而取决于這一頁上有没有別處看不到的内容。

  • 列表項自带摘要、價格、更新時間等字段,第 2 頁和第 1 頁展示的信息不同,這類翻頁有獨立價值。
  • 列表項只有标题和連結,第 1 頁已经覆盖了大部分内容,後續翻頁的增量很低。
  • 翻頁只是把同一批資料重新排序,比如按價格、按销量,地址不同但内容高度重叠。

前一類可以考虑放行,後两類更适合合並或屏蔽。

三種常见的翻頁地址形態

參數式地址

形如 /list?page=2/list?p=2&sort=price。這類地址最容易产生组合爆炸:分頁參數、排序參數、篩選參數相乘,几天就能生成几千個 URL。治理的第一步是收敛參數,把排序和篩選组合控制在少數几個常用组合上。

路径式地址

形如 /list/page/2//news/2/。路径式地址通常更稳定,也更容易被蜘蛛顺着連結一层层走下去。如果决定屏蔽,需要在 robots.txt 里把路径規則寫清楚,而不是只在頁面上做處理。

無地址的加载更多

点击“加载更多”只是把新内容追加到同一個 URL 下。這類设計對讀者友好,但蜘蛛看不到後面的内容。如果後面的内容确實重要,至少给一個可訪問的静態翻頁入口。

放行时要注意什么

  1. 给第 1 頁一個稳定的規范地址,後續翻頁各自規范到自己,不要全部指向第 1 頁,否則收錄的永遠只有一個地址。
  2. 翻頁連結用普通的 a 标簽,不要依赖 JavaScript 事件才能跳轉。
  3. 每個翻頁頁面有自己的标题和描述,避免出現一串只有頁碼不同的重复标题。
  4. 控制翻頁深度。第 50 頁之後基本没有抓取價值,可以自行截断連結,但不要做得太隐蔽。

合並或屏蔽时怎么做

如果决定不做收錄,常见做法有三種,效果並不相同:

  • canonical 指向聚合頁:适合排序、篩選這類同内容變体。它保留可訪問性,同时說明真正的規范地址是哪一個。
  • noindex:适合确實不希望出現在索引里的翻頁。注意 noindex 和 robots.txt 不要同时用——一旦被 robots.txt 拦下,頁面上的 noindex 也就讀不到了。
  • robots.txt 屏蔽:适合量級大、完全不需要收錄的翻頁。屏蔽前先確認這些地址上没有被其他頁面依赖的連結,否則會顺带切断深层頁面的抓取路径。
翻頁地址最常见的错誤不是屏蔽或放行本身,而是同一站点里三種做法混着用:一部分翻頁做 canonical,一部分做 noindex,還有一部分被 robots.txt 挡住。規則不统一,索引狀態就會變得很难解释。

把分頁当成一條規則来處理

不要逐頁判断,而是按“參數類型 + 内容形態”给分頁定几條規則:什么情况下放行、什么情况下規范到聚合頁、什么情况下屏蔽。規則定好之後,用索引报告和日誌抽查几组地址,確認實际狀態和预期一致。分頁本身不是内容,但它决定了蜘蛛能不能顺着列表走到你最想被收錄的那些詳情頁,值得單獨花時間梳理。