網站收錄

分頁與列表頁的收錄處理:翻頁 URL 该不该留在索引里

列表頁和分頁往往是站点里 URL 數量最多的一批地址。本文把翻頁 URL 分成频道頁、分頁序列與篩選组合三類,說明保留抓取、noindex、canonical 合並三種做法的适用邊界,並给出一份可执行的检查顺序,帮助在抓取路径與索引体积之間找到平衡。

網站收錄

分頁與列表頁的收錄處理:翻頁 URL 该不该留在索引里

一個电商站或内容站,URL 數量最大的往往不是詳情頁,而是列表頁翻到第 2、3、50 頁的那些地址。這些頁面标题相似、正文只差几條,處理方式一旦一刀切,要么索引被稀释,要么深层内容失去入口。

下面按「先分類、再决定、最後驗證」的顺序,说清翻頁 URL 的處理邊界。

先分清三類翻頁 URL

  • 频道或栏目首頁:通常是聚合入口,自身有獨立價值,應当被收錄。
  • 分頁序列:?page=2、/list_2.html、/page/2/ 這類,内容随頁碼變化,越往後價值越低。
  • 篩選與排序产生的组合頁:颜色、價格区間、排序方式叠加出的地址,數量可能指數級增長。

第一類不在本文讨论范围;第三類更接近參數頁問题,和分頁分開處理。真正需要拿捏的是第二類。

翻頁 URL 的價值在哪

分頁承担两個作用:一是让用戶繼續往下浏览,二是让蜘蛛顺着連結爬到更深的詳情頁。第二個作用常被忽略——如果站内没有別的通往深层内容的路径,分頁就是那條路。

所以判断标准不是「分頁有没有原创内容」,而是「拿掉它之後,深层頁面還有没有其他入口」。如果站点地图、相關推荐、标簽頁已经能覆盖,分頁的抓取價值就低;如果深层内容只能靠一路翻頁到達,直接掐掉會连抓取路径一起掐掉。

三種常见處理方式與邊界

1. 保留可抓取,但不强求收錄

最常见的做法:分頁 URL 不做 noindex,也不做 canonical 合並,保持 200 狀態,連結可跟随,由搜尋引擎自行判断要不要收。同时在标题上做一点区分,例如带上「第 3 頁」,方便识別序列。

這種方式的問题是會消耗抓取額度,頁碼越深越明顯。可以用限制可翻頁深度来抵消:超過一定頁碼後,連結不再直接出現在 HTML 里,或改成「加载更多」按钮由脚本触發。

2. noindex 分頁

当分頁内容高度重复、頁碼极多时,可以给第二頁之後的 URL 加 noindex。注意两点:

  • noindex 頁面上的連結仍可被跟随,前提是不要同时屏蔽抓取,否則标簽讀不到,頁面可能長期留在索引里。
  • 不要给第一頁加 noindex,也不要一邊给全部分頁加 noindex,一邊指望列表入口本身被收錄。

3. canonical 指向第一頁

這種做法要谨慎。把 /page/2/ 的 canonical 指向 /page/1/,等于告诉搜尋引擎「這几頁是同一篇内容」,第一頁會被当作聚合视图,但分頁上獨有的條目可能一起被忽略。

如果分頁只是第一頁的重复切分,指向第一頁尚可;如果每頁展示的是不同的條目集合,通常更建议 canonical 指向自身。

翻頁之外的两個衍生問题

「查看全部」頁面

把所有條目塞進一個長頁面,理论上可以合並分頁權重,但會让頁面体积變大、加载變慢,移動端体驗也差。比較稳的做法是保留它但不作為主要入口,或只在條目數量可控的栏目里使用。

無限滚動與加载更多

内容靠脚本追加时,搜尋引擎未必會触發滚動。至少要保證分頁 URL 真實存在且可訪問,让追加部分有一條不依赖交互的抓取路径,否則「加载更多」之後的内容可能一直不被發現。

一個可执行的检查顺序

  1. 統計站内翻頁 URL 的數量級,看它是否占了索引的很大比例。
  2. 抽查深层詳情頁,確認除了翻頁還有没有其他入口。
  3. 检查分頁的 title、H1 是否有頁碼区分,是否全部相同。
  4. 確認加了 noindex 的頁面没有被 robots.txt 屏蔽。
  5. 查看抓取統計,判断翻頁消耗了多少抓取量。
  6. 根據以上结果,在保留、noindex、canonical 合並中選定一種,不要混用。

調整之後不要指望立刻见效,索引的增减通常滞後數周。观察重点也不是分頁本身有没有被收錄,而是詳情頁的發現速度有没有變慢、抓取額度有没有腾出来给更重要的頁面。

小结

分頁 URL 的處理没有统一答案,核心是两條线:抓取路径和索引体积。先確認拿掉分頁不會断掉深层内容的入口,再决定它该不该留在索引里。多種信号混用(noindex 加屏蔽抓取再加 canonical 合並)通常比不處理還糟。