分頁列表是很多站点收錄數量的大头。一個只有几十篇内容的栏目,因為 page/2 到 page/30 都被收錄,索引里可能多出几百個 URL。這些頁面值不值得占用索引位和抓取预算,需要按目的分開判断,而不是一刀切。
先分清站点里三種像分頁的頁面
- 列表分頁:栏目頁第 2、3、N 頁,内容是文章列表的下一段。
- 篩選與排序:價格排序、颜色篩選、時間倒序等參數生成的頁面,很多站点把它做成了可抓取的連結。
- 滚動加载:前端加载更多,如果同时生成了獨立 URL,也會形成類似分頁的地址。
三類里,第一類是規划内的,後两類多數是顺带产生的,處理方式並不相同。
分頁该不该被收錄:看它有没有獨立價值
判断标准可以简單一点:這個 URL 有没有可能作為獨立结果被点開。列表分頁本身通常没有獨立搜尋需求,用戶不會去搜“第 3 頁”。但如果分頁地址上承载了第一頁没有的内容,比如第一頁只放置顶和推荐、正文條目從第二頁才開始,那它就有被收錄的理由。
可以保留收錄的情况
- 分頁承担了完整内容的分段,每頁之間有明确差异。
- 頁面有獨立的标题、描述和站内導航,能正常作為落地頁使用。
- 站点内容体量小,分頁數量有限,對抓取预算影响不大。
可以考虑收敛的情况
- 篩選、排序參數頁大量重复,只是顺序不同。
- 分頁内容與第一頁高度重叠,没有獨立價值。
- 分頁數量遠大于内容數量,索引被列表頁占满。
几種常见處理方式與它們的副作用
1. 所有分頁 canonical 都指向第一頁
這是最常见的做法,等于告诉搜尋引擎這些頁面的内容都属于第一頁。结果是分頁不進索引、連結信号被合並,一般問题不大。但要確認分頁确實没有獨立内容,否則第一頁會背上不属于它的内容,反而干扰第一頁本身的判断。
2. 用 rel=prev / next 标注
這套标注早就不再作為收錄信号使用,保留它不會有坏處,但不要指望靠它控制收錄。真正起作用的是連結是否可抓取,以及頁面上有没有 noindex。
3. 给分頁加 noindex
noindex 能阻止頁面進索引,但不會阻止抓取。搜尋引擎仍會抓取這些頁面,以便發現第一頁没有的深层連結。所以 noindex 适合内容重复、但不承担發現职责的分頁。注意別把 noindex 加到需要被收錄的列表入口上。
4. 用 robots.txt 屏蔽分頁
屏蔽後搜尋引擎不會再抓取,也就看不到分頁上的内鏈。如果站点深處的内容只能通過分頁被發現,屏蔽會直接切断這條發現路径。用之前先確認這些 URL 有没有別的入口,比如 sitemap 或其他内鏈。
一個可以照着走的检查顺序
- 按路径模式統計分頁和參數頁的數量,看它們在索引里占多大比例。
- 抽查几個分頁 URL,確認是否有獨立内容、是否真的出現在结果里。
- 检查分頁連結是不是真正的 a 标簽,而不是 JavaScript 点击事件。
- 確認篩選參數頁有没有被無意做成可抓取内鏈,尤其是排序和每頁條數。
- 對确定要收敛的頁面,優先用 noindex 或 canonical,最後再考虑 robots.txt。
- 收敛完成後观察一到两個抓取周期,看索引數量和抓取分布的變化。
分頁處理的目标不是让分頁统统不被收錄,而是让索引里留下的 URL 都能承担一個明确的作用。數量下降本身不是坏事。
收敛之後看什么
處理完之後重点观察三件事:索引總量是否下降、深层内容頁的抓取是否變多、第一頁的展示和点击有没有變化。如果索引下降但深层頁面抓取没有增加,說明發現路径被切断了,需要补回站内連結或 sitemap。如果只是索引數字下降、其他指标平稳,通常說明這次收敛是有效的。