網站收錄

列表頁分頁與收錄:哪些翻頁该放開,哪些该收敛

列表頁翻頁很容易生成大量近似 URL,全放開可能稀释頁面质量,全屏蔽又會让深层内容更难被發現。這篇文章從分頁 URL 的几種形態说起,讲清 noindex、robots.txt 與 canonical 在分頁场景下的差別,並给出一個從日誌到索引的自查顺序,帮助你决定哪些翻頁值得保留。

網站收錄

列表頁分頁與收錄:哪些翻頁该放開,哪些该收敛

列表頁翻頁是收錄問题里比較容易被忽略的一块。首頁和栏目第一頁通常會被認真對待,但翻到第 5 頁、第 20 頁的地址,往往在上线时顺手放開,之後就很少再看。结果是要么索引里堆了一批内容高度相似的頁面,要么把翻頁全部屏蔽,反而让一部分只在深层列表里出現的内容更难被蜘蛛發現。

翻頁 URL 的几種常见形態

同样是翻頁,地址形態不一样,處理方式也會不同。常见的有參數式,例如 ?page=2;路径式,例如 /list/page/2/;還有把篩選、排序和翻頁叠在一起的形式,例如同时带 ?category=?sort=?page=。前两種相對可控,第三種容易组合出大量 URL,是收錄膨胀的主要来源。

這些地址指向的内容,往往只是同一批條目的不同排列顺序。對用戶来说翻頁是浏览動作,對搜尋引擎来说却是另一個可抓取的 URL。是否值得让它們進入索引,取决于這些頁面上有没有獨立的、可被搜尋的價值。

全放開、部分放開與收敛

全放開

内容總量不大、翻頁深度有限、每頁條目有明确区分的栏目,可以保持放開。典型情况是列表本身就有检索價值,比如按時間排列的上新頁,翻到後面仍然是不同内容。

只放開前几頁

更常见的做法是前几頁正常放開,更深的翻頁做收敛。深度阈值没有固定數字,可以结合實际抓取情况和頁面價值来定。判断依據是:蜘蛛在翻頁上花掉的時間,是否明顯影响了真正重要的頁面被重新抓取。

用 noindex 還是 robots.txt

這里是分頁處理中最容易出错的地方。robots.txt 拦截後,蜘蛛看不到頁面上的 noindex 指令,如果頁面已经被索引,拦截本身並不能让它登出索引,只是不再抓取。相對稳妥的顺序通常是:先让頁面返回 noindex,等索引里的地址逐渐减少,再考虑是否需要進一步限制抓取。反過来先加 robots.txt,往往會卡在半路。

篩選與排序參數要分開對待

分頁參數、排序參數和跟踪參數性质不同。排序和篩選會改變頁面内容组合,可能形成獨立的落地頁;跟踪參數不改變内容,更适合用 canonical 指向主地址来收敛。把這些參數统一当成一類處理,容易出現该保留的被屏蔽、该收敛的被放開。

一個可执行的自查顺序

  1. 先從日誌里看翻頁 URL 被抓取的次數和频次,確認它占了多少抓取份額。
  2. 再查索引里已经存在哪些翻頁地址,統計它們分布在哪些栏目、深度大概到第几頁。
  3. 逐個栏目判断:這些翻頁頁面有没有獨立搜尋價值,還是只是同一批内容的重复排列。
  4. 根據判断结果選擇手段:保留放開、canonical 收敛、noindex 登出索引,或調整站内連結不再指向深层翻頁。
  5. 改動之後再观察一段時間,重点看目标頁面的抓取和索引是否往预期方向變化,而不是盯着單日數字。

几個容易忽略的细节

  • 翻頁頁面之間的标题和描述如果完全一样,即便内容排列不同,辨识度也很低。
  • 分頁連結不要全部用 JS 渲染後才出現,否則蜘蛛可能连翻頁入口都看不到。
  • 列表頁第一頁和翻頁之間尽量保持連結连通,避免出現只能靠參數拼接才能到達的孤岛地址。
  • 站点規模變大後,翻頁的抓取開销會放大,早期定好規則比後期清理省事。

分頁收錄没有通用答案。同样是第 10 頁,在不同類型的站点里意义可能完全不同。與其套用某個模板規則,不如先把日誌和索引里的實际情况看清楚,再决定哪些翻頁值得留下。

處理分頁收錄,先看現状再定手段:日誌里翻頁占了多少抓取、索引里已经存在哪些地址,比直接套用某個模板更有參考價值。