列表頁、目錄頁翻到第二頁、第三頁时产生的新 URL,常常在收錄报告里占掉一大块。這些頁面该不该進索引没有统一答案,要看它有没有獨立用途、有没有人鏈過去、會不會和第一頁抢同一批词。
分頁 URL 的三種常见形態
- 路径式:/list/page/2/,结构清楚,容易被当成同一组頁面。
- 參數式:/list?page=2,容易和排序、篩選參數混在一起,生成大量组合 URL。
- 点击加载:滚動到底自動加载,地址栏不變。蜘蛛通常看不到後續内容,需要額外的可抓取連結来补。
判断某一頁要不要留在索引里
- 這一頁上有多少内容是第一頁没有的?只是同一批條目換個顺序,價值有限。
- 有没有内鏈指向它?如果只有分頁導航一條路径,發現和更新都會慢。
- 搜尋的人有没有可能直接落到這一頁?長尾词偶尔會落在深分頁上,但概率不高。
- 它的标题、描述、H1 是不是直接复用了第一頁?大量重复的元資料會削弱它單獨出現的机會。
几種處理方式的代價
全部放開抓取和索引
好處是结构简單,深层内容容易被發現;代價是索引里塞進大量近似頁面,抓取预算被消耗在低價值 URL 上。
可抓取,但 noindex
不占索引位,蜘蛛仍能顺着連結往深處走。注意 noindex 不等于不抓取,頁面還是會被訪問,只是不進索引。如果第二頁确實有獨有内容,這样做會一並排除掉。
canonical 指向第一頁
這是最常见的誤用之一。分頁並不是重复内容,把它指向第一頁,等于声明這一頁是第一頁的副本,獨有内容可能被一起送走,搜尋引擎也有可能直接忽略這個信号。
robots.txt 屏蔽分頁
一般不推荐。屏蔽之後连頁面上的連結都看不到,第二頁往後更难被發現,等于把一條通路堵死。
URL 上可以提前做的整理
- 分頁參數保持一種寫法,不要同时存在 ?page= 和 /page/。
- 排序、篩選參數尽量和分頁分离,避免生成近乎無限的组合。
- 固定每頁條數,別因為每頁 20、50、100 再生成多套分頁。
- 不要让分頁带上不该有的跟踪參數,它只會制造更多重复 URL。
内鏈怎么寫,蜘蛛才走得下去
第一頁連結到第二頁,第二頁再到第三頁,逐級递進;分頁導航用普通 a 标簽,別只做成按钮。若内容量确實大,可以给一個查看全部的入口,但同样要考虑它會不會和分頁形成重复。
分頁不一定要全部進索引,但最好都能被抓到。抓取是通路,索引是篩選,两件事分開處理會清晰很多。
上线後的检查清單
- 從第一頁能否一步步点到最後一頁。
- 深分頁上有没有獨有的商品、文章或标题。
- 分頁是否誤加了 canonical 或 noindex。
- 分頁 URL 是否随篩選、排序组合爆炸。
- 收錄报告里分頁占比是否異常增長。
分頁的收錄處理没有一刀切的答案,核心是分清哪些頁面承载了獨有内容,哪些只是浏览路径。把這條路想清楚,索引里留下的東西會干净不少。