網站收錄

分頁 URL 要不要收錄:先判断列表頁有没有獨立價值,再决定保留、归並還是收敛

分頁 URL 该不该進索引,取决于列表頁本身有没有獨立價值。本文把内容列表分頁、長文分頁、篩選结果分頁拆開看,给出保留自指 canonical、归並到第一頁、noindex 收敛三種處理方式,並說明為什么可以不收錄但仍允许被抓取,最後给出上线後的核對顺序。

網站收錄

分頁 URL 要不要收錄:先判断列表頁有没有獨立價值,再决定保留、归並還是收敛

分頁是列表頁最常见的變体:分類第二頁、标簽第三頁、搜尋结果第 N 頁。這些 URL 该不该進索引,没有统一答案,取决于分頁頁面上有没有用戶會主動搜尋的獨立内容。先判断價值,再選處理方式,比直接套一條規則更稳。

先分清站内三種“分頁”

外观相似,處理逻辑完全不同:

  • 内容列表分頁:文章列表、商品列表的第 2、3 頁。頁面主体是标题和摘要,偏導航性质。
  • 長文分頁:一篇教程被拆成 page=1/2/3。每頁都承载獨立正文,通常應让第一頁自指 canonical,或直接改成一頁展示。
  • 站内搜尋或篩選结果分頁:參數组合容易爆炸,往往是抓取配額的黑洞,處理優先級最高。

判断分頁有没有獨立價值的几個問题

  • 用戶會不會用“某個分類 第 2 頁”這類词来搜尋?多數情况下不會。
  • 第二頁上的條目,是否已经通過其他入口被連結到?如果去掉分頁就發現不了,那分頁承担的是發現职责。
  • 分頁頁面的标题和描述,是否只是複製第一頁?重复度越高,獨立價值越低。

三種處理方式的适用场景

保留:让每頁自指 canonical

当列表本身就是被搜尋的目标,且分頁有差异化标题、内容能稳定更新时,可以让每頁自指,並在标题里带上頁碼或時間范围。要注意翻頁後的條目會不断變動,頁面内容频繁變化,索引结果也可能随之波動,這属于正常現象。

归並:canonical 指向第一頁

列表頁只是導航、條目本身各有獨立詳情頁时,常见做法是把 page=2、page=3 的 canonical 指向第一頁,让信号集中。需要確認的是:第一頁确實能通過正常導航到達,且不是 noindex 狀態,否則归並就成了把所有分頁一起推出索引之外。

收敛:不让人抓,或改成交互

參數组合過多、頁面價值极低时,可以用 robots.txt 屏蔽带分頁參數的路径,或在頁面級加 noindex。也可以把“下一頁”改造成按钮式加载或滚動加载——但這會切断爬虫顺着連結發現深层内容的路径,需要配合其他發現方式。

別忽略分頁在 URL 發現里的作用

很多新文章的第一條發現路径,就是從列表第一頁顺着“下一頁”被爬到的。如果直接屏蔽所有分頁,等于關掉了一條稳定的發現通道。

處理分頁时,建议把“要不要收錄”和“要不要被抓”分開看:可以不收錄,但仍允许被爬取,用来传递發現路径。

比較稳妥的组合是:不彻底屏蔽分頁路径,而在頁面級用 noindex 控制是否入索引;同时在 Sitemap 里直接提交詳情頁 URL,减少對分頁鏈路發現的依赖。

上线後的核對顺序

  1. 在抓取日誌里按分頁參數分组,看爬虫把配額花在哪一层,尤其是翻到很深的頁碼。
  2. 用索引狀態查询確認分頁 URL 實际是“已收錄”“已排除”還是“已發現未编入”。
  3. 抽查几個分頁的 canonical,確認它指向的頁面本身是可被索引的。
  4. 對比詳情頁的收錄覆盖率有没有因為分頁調整而下降,重点看新發布的内容。
  5. 观察一到两個抓取周期再决定是否繼續收紧,避免一次性改動過大。

分頁處理没有一步到位的答案。先想清楚這個列表頁對用戶和爬虫分別有什么用,再在保留、归並、收敛中選一個组合,並留出观察期,通常比追求“统一規則”更省事。