網站收錄

分頁列表被大量收錄:翻頁頁面的取舍與收口顺序

列表翻頁被搜尋索引收錄,既有可能是正常入口,也可能只是重复内容占着抓取配額。本文把翻頁頁分成系列分頁、列表分頁、篩選分頁三類,按搜尋需求、内容差异、抓取占比和連結發現四個角度判断是否保留收錄,並梳理 canonical、noindex、翻頁深度限制的适用场景與副作用,最後给出可执行的核對顺序。

網站收錄

分頁列表被大量收錄:翻頁頁面的取舍與收口顺序

站点的列表翻頁(常见的 /page/2、?paged=3、list_2.html)被搜尋索引收進去,是很多站点都會遇到的情况。它未必是坏事:有些翻頁頁确實有獨立入口價值,也有些纯粹是重复内容的载体,占着抓取配額。难点在于两類頁面没有明顯的分界线,所以要先判断角色,再决定收口方式,而不是统一一刀切。

先给翻頁頁分個類

按頁面的實际功能分成三類,處理方式會清楚很多:

  • 系列内容分頁:長文、连载、教程的第二三頁,用戶會顺着讀下去,頁面上有内容增量。
  • 列表導航分頁:文章列表、商品列表翻頁,主要作用是發現新連結,頁面之間差异有限。
  • 篩選排序分頁:带篩選參數或排序參數生成的组合,數量容易失控,重复度也往往偏高。

判断值不值得收錄的几個角度

  1. 有没有搜尋需求:如果用戶會直接搜某類内容的第二頁、第三頁,保留收錄通常更合理。
  2. 内容是否只是重复:翻頁頁如果只有标题列表變化,正文结构與第一頁高度相似,價值有限。
  3. 抓取日誌里的占比:翻頁頁吃掉大量抓取次數、挤占詳情頁,就要考虑收口。
  4. 被發現的新連結:如果詳情頁主要靠列表頁被發現,收口时要保證内鏈通路不被切断。

常见收口方式與各自的副作用

canonical 指向第一頁

适合翻頁只是同一批内容另一種排列的情况。要注意第一頁本身必须自指,不要出現整條鏈路都指向別處的循环。若某一頁确實有獨立價值,就不要把它並到第一頁。

noindex, follow

适合不希望翻頁頁進入索引、但仍希望蜘蛛顺着連結爬到詳情頁的场景。寫成 noindex, nofollow 會同时断掉連結發現,除非你另有替代入口。

限制翻頁深度與連結暴露

比如只让前几頁在站内可点,後面的頁靠接口或按需加载。這種做法會让部分頁面难以被抓到,取舍时要把用戶能否到達和蜘蛛能否到達分開看。

一個容易忽略的冲突:同一批翻頁頁里,有的用 canonical 指向第一頁,有的用 noindex,還有的两種都寫。指令混用时搜尋引擎會自行判断,最终结果往往與预期不一致。改之前先把現状列成表,比改之後反复猜要省事。

調整之後的核對顺序

  1. 抓取日誌:看翻頁頁的抓取频次是否下降,詳情頁是否相應增加。
  2. 索引狀態:抽查若干翻頁 URL,確認是移出還是仍在,留意生效本身有延迟。
  3. 内鏈通路:確認深层詳情頁仍有可被抓到的入口,没有變成孤岛。
  4. sitemap 與 robots:提交的文件里不要再包含已经不打算收錄的翻頁地址,避免信号互相矛盾。

记錄變更,別反复折腾

翻頁收口很少一次到位。建议把改動時間、改動方式、当时的抓取與索引資料记在同一處,隔一段時間再看趋势。多次来回切換 canonical 與 noindex,反而會让這類頁面在搜尋引擎眼中的處理方式更不稳定。