網站收錄

分頁列表被大量收錄:page/2、page/3 该收敛還是保留

列表分頁常常是站点索引數量的大头,一個几十篇内容的栏目可能带出几百個 URL。本文把列表分頁、篩選參數、加载更多三類分開處理,對比 canonical、noindex、robots.txt 各自适合的场景與副作用,並给出一份可以照着走的检查顺序和收敛後的观察指标。

網站收錄

分頁列表被大量收錄:page/2、page/3 该收敛還是保留

分頁列表是很多站点收錄數量的大头。一個只有几十篇内容的栏目,因為 page/2 到 page/30 都被收錄,索引里可能多出几百個 URL。這些頁面值不值得占用索引位和抓取预算,需要按目的分開判断,而不是一刀切。

先分清站点里三種像分頁的頁面

  • 列表分頁:栏目頁第 2、3、N 頁,内容是文章列表的下一段。
  • 篩選與排序:價格排序、颜色篩選、時間倒序等參數生成的頁面,很多站点把它做成了可抓取的連結。
  • 滚動加载:前端加载更多,如果同时生成了獨立 URL,也會形成類似分頁的地址。

三類里,第一類是規划内的,後两類多數是顺带产生的,處理方式並不相同。

分頁该不该被收錄:看它有没有獨立價值

判断标准可以简單一点:這個 URL 有没有可能作為獨立结果被点開。列表分頁本身通常没有獨立搜尋需求,用戶不會去搜“第 3 頁”。但如果分頁地址上承载了第一頁没有的内容,比如第一頁只放置顶和推荐、正文條目從第二頁才開始,那它就有被收錄的理由。

可以保留收錄的情况

  • 分頁承担了完整内容的分段,每頁之間有明确差异。
  • 頁面有獨立的标题、描述和站内導航,能正常作為落地頁使用。
  • 站点内容体量小,分頁數量有限,對抓取预算影响不大。

可以考虑收敛的情况

  • 篩選、排序參數頁大量重复,只是顺序不同。
  • 分頁内容與第一頁高度重叠,没有獨立價值。
  • 分頁數量遠大于内容數量,索引被列表頁占满。

几種常见處理方式與它們的副作用

1. 所有分頁 canonical 都指向第一頁

這是最常见的做法,等于告诉搜尋引擎這些頁面的内容都属于第一頁。结果是分頁不進索引、連結信号被合並,一般問题不大。但要確認分頁确實没有獨立内容,否則第一頁會背上不属于它的内容,反而干扰第一頁本身的判断。

2. 用 rel=prev / next 标注

這套标注早就不再作為收錄信号使用,保留它不會有坏處,但不要指望靠它控制收錄。真正起作用的是連結是否可抓取,以及頁面上有没有 noindex。

3. 给分頁加 noindex

noindex 能阻止頁面進索引,但不會阻止抓取。搜尋引擎仍會抓取這些頁面,以便發現第一頁没有的深层連結。所以 noindex 适合内容重复、但不承担發現职责的分頁。注意別把 noindex 加到需要被收錄的列表入口上。

4. 用 robots.txt 屏蔽分頁

屏蔽後搜尋引擎不會再抓取,也就看不到分頁上的内鏈。如果站点深處的内容只能通過分頁被發現,屏蔽會直接切断這條發現路径。用之前先確認這些 URL 有没有別的入口,比如 sitemap 或其他内鏈。

一個可以照着走的检查顺序

  1. 按路径模式統計分頁和參數頁的數量,看它們在索引里占多大比例。
  2. 抽查几個分頁 URL,確認是否有獨立内容、是否真的出現在结果里。
  3. 检查分頁連結是不是真正的 a 标簽,而不是 JavaScript 点击事件。
  4. 確認篩選參數頁有没有被無意做成可抓取内鏈,尤其是排序和每頁條數。
  5. 對确定要收敛的頁面,優先用 noindex 或 canonical,最後再考虑 robots.txt。
  6. 收敛完成後观察一到两個抓取周期,看索引數量和抓取分布的變化。
分頁處理的目标不是让分頁统统不被收錄,而是让索引里留下的 URL 都能承担一個明确的作用。數量下降本身不是坏事。

收敛之後看什么

處理完之後重点观察三件事:索引總量是否下降、深层内容頁的抓取是否變多、第一頁的展示和点击有没有變化。如果索引下降但深层頁面抓取没有增加,說明發現路径被切断了,需要补回站内連結或 sitemap。如果只是索引數字下降、其他指标平稳,通常說明這次收敛是有效的。