網站收錄

翻頁和列表頁的收錄取舍:canonical 指向第一頁是不是好做法

分類頁、标簽頁和列表的翻頁地址,是站点里數量最多、内容最相似的一批頁面。本文讨论翻頁頁面要不要收錄、canonical 指向第一頁在什么情况下會失效、noindex 與站点地图為什么會互相矛盾,以及從抓取预算角度该怎么安排分頁入口。

網站收錄

翻頁和列表頁的收錄取舍:canonical 指向第一頁是不是好做法

列表頁和翻頁頁面到底算不算内容

分類頁、标簽頁、搜尋结果頁,以及列表的第 2 頁到第 N 頁,通常由模板生成,正文是若干标题和摘要的组合。它們對用戶有價值——用戶确實會翻頁找東西——但對搜尋引擎来说,獨立性很弱:去掉翻頁導航後,第 2 頁和別的列表頁差別不大。

于是就出現了取舍:全部放開收錄,會带来大量近似頁面;全部屏蔽,又可能切断爬虫發現深层内容的路径。

三種常见處理方式和各自的代價

canonical 指向第一頁

做法是把 /list?page=2 到 /list?page=N 的 canonical 都指向 /list。表面上是把信号集中了,但搜尋引擎不一定接受:如果它判断這些頁面的内容确實不同,canonical 可能被忽略。更麻烦的是,如果第一頁只展示最新十篇文章,而第五頁的文章在別處没有任何内部連結,這些文章就很难被發現。

所以這種做法更适合「翻頁只是同一批内容的重新排列」的场景,不适合「每頁承载不同文章連結」的场景。

加 noindex

noindex 的頁面仍然可以被抓取,連結還是能被發現,這是它的優点。但要注意两点:一是 noindex 頁面如果同时提交進站点地图,信号自相矛盾;二是被 noindex 的頁面难以传递連結信号,如果頁面上挂着重要連結,损失是實打實的。

放開收錄但把 URL 收敛干净

有些站点不限制收錄,而是控制參數:只允许一種參數顺序、禁止會话參數和排序參數進入可抓取范围、给每種篩選组合一個稳定地址。前提是 URL 變体管得住,否則參數组合會爆炸,反而制造出更多重复地址。

抓取预算的角度

翻頁鏈條往往很長。如果每頁只有十條連結,而站点有几十萬條内容,爬虫需要走非常深的翻頁路径才能覆盖。此时更有效的做法是让列表頁提供足够入口(加大每頁條數、增加年份或字母索引頁),而不是纠结翻頁本身要不要收錄。

抓取预算的本质不是「爬虫能爬多少」,而是「你希望它優先爬什么」。

自查顺序

  1. 先看翻頁 URL 的參數規則是否稳定,有没有排序、會话、追踪參數混進来。
  2. 用日誌確認爬虫實际訪問了多少翻頁頁面、是否在深翻頁上反复消耗。
  3. 確認目标内容頁是否都有不依赖翻頁的内鏈入口。
  4. 再决定策略:只收敛參數、加 canonical,還是 noindex。同一批 URL 上不要叠加使用。
  5. 改完後观察抓取分布的變化,而不是只盯着索引總量。

小结

翻頁和列表頁的收錄没有统一答案。判断标准可以简化成两個問题:這些頁面被單獨召回时,用戶會不會觉得答非所問?不依赖它們,深层内容還能不能被爬到?這两個問题的答案,基本就决定了该收敛還是该放開。