網站收錄

分頁和列表翻頁的收錄:哪些该留、哪些该收口

站点里除了正文頁,還有大量翻頁 URL:長文拆頁、栏目翻頁、标簽聚合翻頁。它們容易被大量抓取,却未必值得都進索引。本文按内容分頁和列表分頁两類,讲清判断标准、canonical 與收口方式的取舍,以及為什么不要直接用 robots.txt 屏蔽分頁。

網站收錄

分頁和列表翻頁的收錄:哪些该留、哪些该收口

一個站点的 URL 數量里,正文頁往往只占一部分。剩下的很大一块是翻頁:長文被拆成三四屏、栏目列表翻到第二十几頁、标簽頁下還有一层层分頁。這些 URL 该不该被收錄、该怎么标记,很多站点是一刀切的——要么全放開,要么整段 noindex,两種做法都可能留下問题。

先分清两類分頁,它們的性质不一样

内容分頁:一篇文章被拆成多頁

常见于图集、長评测、连载式教程。每一頁都承载原文的一部分,把它們拼起来才是完整内容。這類頁面的正文是互补關系,不是重复關系。

列表分頁:同一批内容換個顺序

栏目列表、标簽归档、搜尋结果、商品篩選结果翻頁。第 2 頁和第 5 頁的区別常常只是排序位置和几條新條目,頁面主体结构、标题、描述高度相似。這類頁面之間更接近重叠關系。

判断标准:這一頁有没有獨立可检索的信息

不要從“是分頁”出發做决定,而是問三個問题:

  • 用戶直接搜到這個 URL,看到的内容對他是否完整、有用?
  • 它的标题和正文,與同组的其他頁是否明顯不同?
  • 如果它不進索引,站内還有没有別的入口能触達它里面的連結和内容?

三個問题里有两個以上是否定答案,這一頁通常就不必争取收錄。

内容分頁:保住正文,別把後續頁全砍掉

把長文拆頁时,常见的错誤是给所有後續頁加 canonical 指向第一頁。這样做的结果是:後續頁上的内容几乎無法單獨參與检索,而用戶從搜尋進来时又常常落在第二、三頁。

更常见的做法是让每一頁自指 canonical,同时保證标题有区分度,例如在标题里带上分頁序号或该頁的小标题。如果站点更看重整篇内容的完整呈現,可以另外做一個不分頁的“全部”頁,把它作為規范版本,並让分頁指向它。两種思路都能成立,關键是要選一種贯穿全站,而不是同一站里两種混用。

列表分頁:越往後越像同一頁

栏目頁的前几頁通常還有收錄價值——它們聚合了近期内容,也常被用戶直接搜到。翻到几十頁之後,頁面之間的差异越来越小,主要作用變成“让蜘蛛繼續往後走”。

實務上有几種處理方式:

  • 保留可抓取、不加 noindex:让分頁連結繼續充当爬行通道,是否收錄交给搜尋引擎判断。對多數中小站点這是省事且低風險的選擇。
  • 對深翻頁做收口:例如超過一定頁數後不再輸出可点击的分頁連結,或改為按時間归档。收口之前要確認老内容仍有其他入口,否則會切断發現路径。
  • 不给分頁單獨寫标题模板:如果每頁标题只是“栏目名 - 第 N 頁”,可以考虑统一風格,减少大量近似标题進入索引。

不要用 robots.txt 屏蔽分頁

這是最常见也最容易踩的坑。用 robots.txt 屏蔽带分頁參數的目錄,看起来能减少抓取,但蜘蛛也讀不到這些頁面上的連結了。列表頁里往往藏着最新發布的文章入口,一屏蔽,新頁面的内鏈通路就断了。

要限制的是“進入索引”,不是“被看到”。想收口用 noindex,想省抓取才考虑 robots,两者不要混着用。

一個简單的自查顺序

  1. 把站内所有翻頁 URL 按来源分成内容分頁和列表分頁两组。
  2. 在每组里各抽 5 個頁面,看标题、正文、摘要是否高度雷同。
  3. 检查這几頁的 canonical 是否自指,全站策略是否一致。
  4. 確認 robots.txt 里没有誤伤分頁目錄。
  5. 检查深翻頁有没有完全脱离内鏈,變成只有蜘蛛能通過舊連結發現的孤岛。
  6. 改動上线後,隔两三周看索引覆盖里的排除原因有没有變化,再决定要不要繼續調整。

小结

分頁不是收錄問题的根源,模板化輸出才是。内容分頁尽量保住每一頁的正文價值,列表分頁重点控制尾部大量近似頁。收口與否取决于這一頁是否解决了一個真實查询,而不是取决于 URL 里有没有參數。改動之後给搜尋引擎留出重新抓取和判断的時間,不要隔天看數字没動就再改一轮。