網站收錄

分頁頁面也被收錄:翻頁地址该留、该並,還是该挡

列表頁、归档頁翻到第二頁往後也被收錄,是很常见的現象。這篇文章梳理分頁地址在索引里的两種身份,区分纯翻頁、带獨立條目、唯一入口三類情况,並對比保留自指、canonical 合並、noindex,follow 與 robots 屏蔽的代價,给出一個相對稳的處理顺序。

網站收錄

分頁頁面也被收錄:翻頁地址该留、该並,還是该挡

列表頁、文章归档頁、商品列表頁翻到第二頁、第三頁,甚至第几十頁,也被搜尋引擎收錄了。這不一定是坏事,但也不一定是好事——分頁地址和普通内容頁的定位不同,處理方式也應该分開看。

先搞清分頁頁在收錄里扮演什么角色

分頁地址通常有两個身份:一是给用戶翻頁用的導航,二是给蜘蛛往深處爬的路径。前者决定它有没有必要出現在搜尋结果里,後者决定你能不能把它整條屏蔽掉。這两個身份经常被混在一起讨论,结果就是要么全留、要么全挡,两種做法都容易留下後遗症。

很多站点在做检索结果頁或商品列表时,第一頁承担了主要的關鍵詞價值,第二頁之後的獨立搜尋需求明顯下降。如果這些地址被大量收錄,索引里就會多出很多内容近似、标题也近似的頁面。

分頁被收錄的三種典型情况

1. 纯翻頁,内容只是同一批條目的不同顺序

這類頁面對用戶和搜尋引擎的獨立價值都很低。收錄了不會直接带来什么問题,但會占用索引空間,也可能让爬虫把時間花在重复地址上。判断标准很简單:把第二頁和第一頁的标题、描述、正文摘要放一起看,如果几乎看不出差別,基本就是這一類。

2. 分頁里出現了第一頁没有的條目

比如商品按上架時間固定排序,第二頁開始有第一頁看不到的商品;或者归档頁按月份切分,翻頁即換内容。這種情况下分頁是需要被發現的,尤其是新上架的條目只能通過翻頁進入时。

3. 分頁是唯一入口

如果站点只靠“下一頁”把所有條目串起来,而没有任何分類、标簽或 sitemap 作為补充路径,那么把分頁挡住,等于把深层頁面一起藏起来。這一條在動手之前一定要先確認。

處理方式與各自的代價

  • 保留並自指 canonical:分頁作為獨立 URL 保留,canonical 指向自己。适合有獨立内容、或者承担發現任務的分頁。
  • canonical 指向第一頁:把後續頁的權重合並到第一頁。代價是這些分頁基本不會以自身身份出現,而且如果指向過于集中,第一頁接收到的重复信号反而變复杂。
  • 加 noindex,follow:頁面不進索引,但連結仍可被跟随,深层地址還能被發現。這是比較常用的折中做法。
  • robots.txt 屏蔽:抓取被直接切断,連結也跟不了。除非這些分頁确實没有任何需要發現的下游地址,否則不建议用。

几個容易踩的坑

  1. 把所有分頁一刀切 noindex。如果詳情頁只能靠翻頁進入,發現速度會明顯變慢。
  2. canonical 全部指向第一頁,却没同步處理分頁自身的标题和描述。容易让搜尋引擎對整组頁面的判断變模糊。
  3. 只做無限滚動,不给可抓取的翻頁連結。用戶能一直滑下去,蜘蛛可能停在第一批條目上。
  4. 分頁 URL 形式不统一。?page=2、/page/2、?paged=2 混用,會让同一批内容出現好几套地址,收錄口径也就跟着乱。

一個相對稳的處理顺序

先把分頁的 URL 形式统一,只保留一種;再逐個判断分頁是不是承载獨立内容或發現任務:是,就保留並自指;不是,就用 noindex,follow。最後回头检查有没有別的路径能到達深层頁面——分類、标簽、站内搜尋、sitemap 都算。如果這些路径都齐了,分頁的價值主要就回到用戶体驗上,收錄與否就没那么關键了。

分頁的取舍本质是一個分配問题:你希望搜尋引擎把精力花在翻頁地址上,還是花在每一件條目本身上。

還有一点,分頁被收錄之後,不建议立刻大批量改成 noindex。索引更新本身有滞後,短時間内你會在报表上看到“收錄没掉、狀態没變”,這属于正常节奏,不必来回調整策略,反而容易让整组頁面的信号反复摇摆。