列表頁和翻頁頁面到底算不算内容
分類頁、标簽頁、搜尋结果頁,以及列表的第 2 頁到第 N 頁,通常由模板生成,正文是若干标题和摘要的组合。它們對用戶有價值——用戶确實會翻頁找東西——但對搜尋引擎来说,獨立性很弱:去掉翻頁導航後,第 2 頁和別的列表頁差別不大。
于是就出現了取舍:全部放開收錄,會带来大量近似頁面;全部屏蔽,又可能切断爬虫發現深层内容的路径。
三種常见處理方式和各自的代價
canonical 指向第一頁
做法是把 /list?page=2 到 /list?page=N 的 canonical 都指向 /list。表面上是把信号集中了,但搜尋引擎不一定接受:如果它判断這些頁面的内容确實不同,canonical 可能被忽略。更麻烦的是,如果第一頁只展示最新十篇文章,而第五頁的文章在別處没有任何内部連結,這些文章就很难被發現。
所以這種做法更适合「翻頁只是同一批内容的重新排列」的场景,不适合「每頁承载不同文章連結」的场景。
加 noindex
noindex 的頁面仍然可以被抓取,連結還是能被發現,這是它的優点。但要注意两点:一是 noindex 頁面如果同时提交進站点地图,信号自相矛盾;二是被 noindex 的頁面难以传递連結信号,如果頁面上挂着重要連結,损失是實打實的。
放開收錄但把 URL 收敛干净
有些站点不限制收錄,而是控制參數:只允许一種參數顺序、禁止會话參數和排序參數進入可抓取范围、给每種篩選组合一個稳定地址。前提是 URL 變体管得住,否則參數组合會爆炸,反而制造出更多重复地址。
抓取预算的角度
翻頁鏈條往往很長。如果每頁只有十條連結,而站点有几十萬條内容,爬虫需要走非常深的翻頁路径才能覆盖。此时更有效的做法是让列表頁提供足够入口(加大每頁條數、增加年份或字母索引頁),而不是纠结翻頁本身要不要收錄。
抓取预算的本质不是「爬虫能爬多少」,而是「你希望它優先爬什么」。
自查顺序
- 先看翻頁 URL 的參數規則是否稳定,有没有排序、會话、追踪參數混進来。
- 用日誌確認爬虫實际訪問了多少翻頁頁面、是否在深翻頁上反复消耗。
- 確認目标内容頁是否都有不依赖翻頁的内鏈入口。
- 再决定策略:只收敛參數、加 canonical,還是 noindex。同一批 URL 上不要叠加使用。
- 改完後观察抓取分布的變化,而不是只盯着索引總量。
小结
翻頁和列表頁的收錄没有统一答案。判断标准可以简化成两個問题:這些頁面被單獨召回时,用戶會不會觉得答非所問?不依赖它們,深层内容還能不能被爬到?這两個問题的答案,基本就决定了该收敛還是该放開。