網站收錄

分頁頁面的收錄處理:先分清列表分頁與内容分頁,再定保留還是收敛

分頁處理常被当成一個問题,结果規則互相冲突。本文把分頁拆成列表分頁與内容分頁两類:前者服務于深度内容的發現,後者服務于阅讀体驗。分別說明该保留哪些頁碼、哪些只需收回連結、哪些适合 noindex,並给出從日誌資料出發的排查顺序,避免抓取額度被無效翻頁占用。

網站收錄

分頁頁面的收錄處理:先分清列表分頁與内容分頁,再定保留還是收敛

分頁在站内很常见,但很多人把它当成一個問题来處理,结果規則互相打架:既想让搜尋引擎抓到列表深處的條目,又嫌抓取額度被翻頁浪費掉。實际動手时,第一步不是设規則,而是先把分頁分成两類——列表分頁和内容分頁,它們的意图、價值和收敛方式都不一样。

两類分頁,要解决的問题不同

列表分頁:為發現更深的内容服務

分類頁、归档頁、商品列表頁的「下一頁」,本质上是一條發現路径。它的價值不在于頁面本身有多少内容,而在于通往後面几頁里的條目。判断要不要保留,看的是:這些深頁里有没有值得單獨收錄的 URL。

内容分頁:為阅讀体驗服務

把一篇長文拆成 /article/1、/article/2,或者把图集拆成多頁。這類分頁通常没有獨立的搜尋需求,用戶也很少從第 3 頁開始讀。它的信息本来是连續的,被拆開後每一頁都像「半篇文章」,容易和主頁面形成近似重复。

列表分頁:按深度和價值分层

深翻頁的價值通常是递减的。前几頁可能還有獨立搜尋需求,到了第 20 頁基本只是歷史归档。一個比較稳的做法是:

  • 前几頁保持可抓取、可索引,让連結正常传递;
  • 更深的頁面减少站内入口,不必刻意出現在主導航或侧栏;
  • 确實没有價值的深頁,可以不加 noindex,只收回連結,让它自然停留在「已發現但未收錄」的狀態;
  • 如果决定用 noindex,要注意頁面上的連結仍會被跟随,別指望它顺手切断發現路径。

這里常见的坑是把 noindex 和「节省抓取額度」画等号。noindex 只影响索引,不阻止抓取;真正减少抓取的,是减少内鏈入口、压缩可翻頁數、以及让翻頁 URL 不要被反复重新生成。

内容分頁:能不分就不分

内容分頁的第一選擇是不分頁。單頁長文如果加载不慢,通常更利于阅讀,也更少出現重复信号。如果因為歷史原因已经拆開,至少要保證几個關系明确:

  1. 每一頁都能回到第一頁,第一頁也能通向後續頁,連結關系清晰;
  2. canonical 預設指向自己,不要把所有分頁都指向第一頁,那會让後續頁的内容彻底失去索引机會;
  3. 如果希望聚合展示,可以考虑保留一個「查看全部」版本,並让分頁指向它;
  4. 不要在分頁上再叠加篩選參數,參數與分頁混在一起时,组合出来的 URL 會成倍增長。

處理顺序:先看資料,再定規則

  1. 從日誌和收錄資料里,找出實际被抓取最多的分頁 URL 模式;
  2. 判断這些頁面有没有獨立搜尋需求,還是纯粹的中轉頁;
  3. 按「保留 / 收回連結 / noindex」三档處理,不要一刀切;
  4. 規則上线後,观察抓取分布是否轉向更關键的頁面,而不是只盯着收錄總數。
分頁處理的目标不是让所有翻頁都消失,也不是让它們全部進索引,而是把抓取額度留给真正有需求的頁面。

几個容易忽略的细节

  • 分頁 URL 尽量用干净的路径或标准參數,避免每次渲染都生成不同的排序參數;
  • 移動端和 PC 端的分頁寫法保持一致,別出現两套地址;
  • 站点地图里只放需要被發現的頁碼,不要把全部翻頁都塞進去;
  • 改規則後给搜尋引擎一点重新抓取的時間,短期内收錄數量波動属于正常現象。

分頁本身不是問题,問题在于把两類目的不同的頁面用同一套規則處理。先分清它服務于「發現」還是「阅讀」,再决定保留、收敛還是不放行,顺序就不會乱。