網站收錄

分頁列表该不该收錄:從第 2 頁開始的取舍與處理顺序

分頁列表頁數量多、容易被反复抓取,但並不都值得進入索引。本文從近似重复、标题雷同、無限翻頁三個常见問题出發,說明什么样的分頁值得收錄,並给出 canonical、noindex、robots.txt 與 sitemap 的處理顺序和自查方法。

網站收錄

分頁列表该不该收錄:從第 2 頁開始的取舍與處理顺序

分頁列表頁是站点里數量最多、也最容易被誤解的一類 URL。蜘蛛确實會顺着“下一頁”一路抓下去,但被抓到只代表“發現”,不代表這一頁适合進入索引。判断分頁该不该收錄,核心問题只有一個:用戶有没有可能带着這一頁獨有的内容去搜尋。

分頁常见的三個問题

  • 近似重复:第 2 頁和第 1 頁的正文结构、模板、侧栏几乎一样,只是内容块顺序不同。
  • 标题雷同:所有分頁共用同一個 title 和 description,索引里分不出主次。
  • 無上限翻頁:page 參數可以一直加,翻到後面常常是空列表或只有几條结果。

哪些分頁值得單獨收錄

  1. 有獨立搜尋需求的:比如長期存在的“最新上架”列表,用戶會直接搜這個列表,而不是搜某個具体商品。
  2. 不同排序维度带来明顯不同结果的:按價格、按销量排序後前几屏差异較大,並且這些頁面有自己的站内入口。
  3. 每頁的挑選逻辑有区分度,而不是简單把同一批内容错位展示一遍。

反過来,翻到第 20 頁之後、内容稀薄、几乎没有站内外入口的分頁,通常不值得占用索引位置。

推荐的收口顺序

  1. 先確認現状:從日誌和索引狀態报告看分頁被抓了多少、被收錄了多少、有多少停在“已發現–尚未抓取”。
  2. 决定保留還是收口:如果主体内容與第一頁基本一致,可以在分頁上放 canonical 指向列表第一頁;如果只是想保留連結發現能力、不想让它進索引,用 noindex,follow。两者不要叠在一起用,否則信号互相矛盾。
  3. 不要用 robots.txt 屏蔽分頁:分頁往往是通往詳情頁的重要路径,一旦屏蔽,蜘蛛顺着断掉的鏈路就停下了,反而拖慢詳情頁的發現。
  4. 给翻頁设上限:超過一定頁數後改用分類、時間区間或篩選條件切分,避免大量低價值 URL 無限增長。
  5. sitemap 只放想被索引的 URL:不打算收錄的分頁不必寫進去,减少“已發現未收錄”的堆积,也让收錄率的統計更接近真實。
  6. 回看效果:調整後观察索引狀態报告里分頁的归類是否稳定,以及詳情頁的抓取量有没有變化。
canonical、noindex、robots.txt 是三種不同层級的工具:robots.txt 管抓取,noindex 管索引,canonical 管“選哪個当代表”。用错层級,常见的结果是頁面既没被收錄,連結也没被传递出去。

一個简單的判断准則

每增加一個分頁 URL,問一句:用戶會不會拿它單獨去搜?如果不會,那它更适合留在“可抓取但不必收錄”的狀態,专心承担把蜘蛛和連結權重引向詳情頁的角色。收錄數量不是越多越好,索引里堆满近似重复的翻頁,反而會稀释整站的頁面质量信号。