分頁是列表頁最常见的變体:分類第二頁、标簽第三頁、搜尋结果第 N 頁。這些 URL 该不该進索引,没有统一答案,取决于分頁頁面上有没有用戶會主動搜尋的獨立内容。先判断價值,再選處理方式,比直接套一條規則更稳。
先分清站内三種“分頁”
外观相似,處理逻辑完全不同:
- 内容列表分頁:文章列表、商品列表的第 2、3 頁。頁面主体是标题和摘要,偏導航性质。
- 長文分頁:一篇教程被拆成 page=1/2/3。每頁都承载獨立正文,通常應让第一頁自指 canonical,或直接改成一頁展示。
- 站内搜尋或篩選结果分頁:參數组合容易爆炸,往往是抓取配額的黑洞,處理優先級最高。
判断分頁有没有獨立價值的几個問题
- 用戶會不會用“某個分類 第 2 頁”這類词来搜尋?多數情况下不會。
- 第二頁上的條目,是否已经通過其他入口被連結到?如果去掉分頁就發現不了,那分頁承担的是發現职责。
- 分頁頁面的标题和描述,是否只是複製第一頁?重复度越高,獨立價值越低。
三種處理方式的适用场景
保留:让每頁自指 canonical
当列表本身就是被搜尋的目标,且分頁有差异化标题、内容能稳定更新时,可以让每頁自指,並在标题里带上頁碼或時間范围。要注意翻頁後的條目會不断變動,頁面内容频繁變化,索引结果也可能随之波動,這属于正常現象。
归並:canonical 指向第一頁
列表頁只是導航、條目本身各有獨立詳情頁时,常见做法是把 page=2、page=3 的 canonical 指向第一頁,让信号集中。需要確認的是:第一頁确實能通過正常導航到達,且不是 noindex 狀態,否則归並就成了把所有分頁一起推出索引之外。
收敛:不让人抓,或改成交互
參數组合過多、頁面價值极低时,可以用 robots.txt 屏蔽带分頁參數的路径,或在頁面級加 noindex。也可以把“下一頁”改造成按钮式加载或滚動加载——但這會切断爬虫顺着連結發現深层内容的路径,需要配合其他發現方式。
別忽略分頁在 URL 發現里的作用
很多新文章的第一條發現路径,就是從列表第一頁顺着“下一頁”被爬到的。如果直接屏蔽所有分頁,等于關掉了一條稳定的發現通道。
處理分頁时,建议把“要不要收錄”和“要不要被抓”分開看:可以不收錄,但仍允许被爬取,用来传递發現路径。
比較稳妥的组合是:不彻底屏蔽分頁路径,而在頁面級用 noindex 控制是否入索引;同时在 Sitemap 里直接提交詳情頁 URL,减少對分頁鏈路發現的依赖。
上线後的核對顺序
- 在抓取日誌里按分頁參數分组,看爬虫把配額花在哪一层,尤其是翻到很深的頁碼。
- 用索引狀態查询確認分頁 URL 實际是“已收錄”“已排除”還是“已發現未编入”。
- 抽查几個分頁的 canonical,確認它指向的頁面本身是可被索引的。
- 對比詳情頁的收錄覆盖率有没有因為分頁調整而下降,重点看新發布的内容。
- 观察一到两個抓取周期再决定是否繼續收紧,避免一次性改動過大。
分頁處理没有一步到位的答案。先想清楚這個列表頁對用戶和爬虫分別有什么用,再在保留、归並、收敛中選一個组合,並留出观察期,通常比追求“统一規則”更省事。