網站收錄

分頁 URL 被大量收錄:頁碼序列的取舍與收敛顺序

列表頁翻頁後产生的 ?page=2、/page/3 這類 URL,很容易被蜘蛛顺着“下一頁”連結一路抓取,最後在索引里留下一長串頁碼頁。本文按 URL 统一、内鏈收敛、收錄策略、抓取预算的顺序,說明哪些分頁值得保留、哪些适合收敛,以及几個常见做法的坑。

網站收錄

分頁 URL 被大量收錄:頁碼序列的取舍與收敛顺序

列表頁翻到第二頁、第三頁,URL 往往變成 ?page=2、/page/3 這样的形式。這些分頁 URL 很容易被蜘蛛顺着“下一頁”連結一路抓下去,最後在索引里留下一長串頁碼頁面。它們既不算完全無用,也很难说是優质内容,處理起来需要先判断,再决定留還是收。

分頁頁為什么容易被大量收錄

原因通常出在發現路径上。分頁連結是站内最密集、最容易递归的一類連結:第一頁鏈到第二頁,第二頁鏈到第三頁,蜘蛛只要進来就會一直往下走,直到没有下一頁為止。如果一個栏目有几十頁,就等于给蜘蛛開了几十個入口,而這些 URL 往往结构相似、内容差异很小。

另一個原因是分頁 URL 常常带參數。?page=2 和 ?p=2、?page=2&sort=new 可能指向同一批内容,但系統把它們当成不同 URL,收錄量就被放大了。

先判断:這些分頁頁有没有獨立價值

不是所有分頁頁都要處理。判断标准可以看两点:用戶會不會主動搜到它,以及它本身有没有獨特信息。

  • 值得保留的:有搜尋需求的分頁,比如某類目第 3 頁本身承接了長尾流量;或者頁碼頁面带有獨立的标题、描述和摘要内容。
  • 可以收敛的:纯粹為了浏览而存在的深頁碼,内容只是列表的重复排列,用戶几乎不會搜到第 8 頁、第 15 頁。
  • 需要規范的:同一分頁内容對應多個參數版本,這属于 URL 規范問题,不是收錄多少的問题。

處理顺序:從發現路径到收錄狀態

  1. 先统一 URL 形式。确定分頁只用一種參數寫法,其他寫法用 301 或 canonical 收敛,避免同一個頁碼存在多個地址。
  2. 再看内鏈是否無限递归。如果分頁是“下一頁”一路串到底,可以考虑只在前几頁保留連結,深頁碼改成跳轉或僅通過分頁组件訪問,减少蜘蛛的無谓抓取。
  3. 然後决定收錄策略。要保留的頁碼頁,给它獨立的标题、描述和必要的摘要内容;要收敛的,用 noindex 让它留在站内可訪問但不進索引,通常比直接屏蔽抓取更稳妥。
  4. 最後看抓取预算。如果分頁 URL 占用了大量抓取配額,導致詳情頁更新變慢,就要優先压缩這部分。

几個容易做错的地方

一是把分頁頁全部 noindex,结果连有流量的頁碼頁一起處理掉了。二是用 robots.txt 屏蔽分頁,蜘蛛抓不到頁面,却仍可能因為外鏈而保留 URL,反而更难收敛。三是把每一頁都 canonical 到第一頁,這會让頁碼頁失去獨立存在的意义,如果它們本身有搜尋流量,這種做法要谨慎。

分頁問题的本质是“發現路径太密”加“URL 形式不统一”。先把這两件事理清,收錄數量通常會回到一個更合理的范围。

至于最终收錄多少、多久生效,取决于站点整体质量和搜尋引擎的判断,没有固定的時間表,也不适合用某個數字去承诺。