網站收錄

分頁 URL 大量被收錄:翻頁序列的取舍與核對顺序

分頁 URL 被大量收錄,不一定就是重复内容問题。本文從翻頁頁面是否有獨立價值出發,對比放開收錄、canonical 指向第一頁、noindex,follow 三種處理方式的代價,並给出抓取日誌、索引狀態與站点地图的核對清單,帮你决定哪些翻頁该保留、哪些该收口。

網站收錄

分頁 URL 大量被收錄:翻頁序列的取舍與核對顺序

列表頁翻到第 20 頁也被收錄,很多人第一反應是“重复内容太多”。但在動手之前,先分清一件事:分頁被收錄,可能是负担,也可能是長尾入口。處理方式不同,结果差別很大。

先判断分頁有没有獨立價值

分頁 URL 和第一頁相比,差异通常只有列表項和排序。判断是否值得保留收錄,可以問三個問题:

  • 列表項本身是否有检索價值?比如商品、房源、职位這類有明确搜尋需求的條目。
  • 翻到後面的頁面,是否還會出現在站内導航或内鏈中?如果只有“下一頁”按钮能到達,實际分發價值有限。
  • 用戶是否可能直接搜尋到這一頁?如果答案基本是否定的,收錄的意义就不大。
分頁的收錄决策,本质是先判断内容價值,再决定技術處理,而不是反過来。

三種常见處理方式,先想清楚代價

一、放開收錄

适合列表項有獨立搜尋需求的站点。前提是分頁 URL 稳定、可抓取,並且每頁有自己的标题與 H1,canonical 自指。否則同一個序列容易出現多個版本互相竞争。

二、canonical 指向第一頁

這會让搜尋引擎倾向于只保留第一頁,但也會连带削弱翻頁頁面上列表項作為入口的價值。如果站点依赖列表頁做内鏈分發,這個操作要谨慎。

三、noindex, follow

頁面不進入索引,但頁面上的連結仍會被跟随。适合“只想要連結分發、不想要頁面本身”的场景。注意 noindex 需要在頁面被抓取到的前提下才生效,如果同时用 robots.txt 屏蔽了该路径,两邊的指令會互相抵消。

核對抓取路径,別让深翻頁吃掉预算

很多站点的翻頁是無限延伸的,“下一頁”可以一路点到几百頁。這類路径的問题不在于收錄本身,而在于蜘蛛會把大量時間花在低價值頁面上,内容頁的重訪频率因此被拉低。

  • 看抓取日誌中翻頁 URL 的占比,如果明顯高于内容頁,說明路径過深。
  • 检查是否存在按頁碼批量生成的入口,比如把全部翻頁塞進了 sitemap。
  • 考虑對超過一定頁數的翻頁做收口,保留前面若干頁可抓取。

翻頁顺序變了,索引也會抖

如果列表按時間或热度排序,翻頁内容會不断變化,同一個 URL 今天對應 A 组列表項,明天可能完全不同。搜尋引擎每次看到的版本都在變,索引狀態就容易波動。如果希望收錄相對稳定,可以考虑让分頁顺序固定下来,或對排序參數做規范化處理。

索引报表里要看的狀態

處理之後不要只看“收錄數量變了多少”,還要看狀態归類:

  1. 被選為規范頁的是第一頁,還是某個翻頁。
  2. “已抓取,尚未编入索引”是否集中出現在翻頁 URL 上。
  3. 同一分頁序列是否有多個版本同时被索引。
  4. 排除原因是否為“重复,未選擇規范頁”或“已被 noindex 标记排除”。

一份可执行的核對清單

  1. 確認分頁 URL 是否稳定,有没有混入篩選、排序、追踪參數。
  2. 確認翻頁頁面上的列表項連結能被抓取,而不是依赖脚本执行後才出現。
  3. 確認 noindex、canonical、robots.txt 三者的指令不冲突。
  4. 確認站点地图里没有包含不必要的翻頁地址。
  5. 观察 2 到 4 周的抓取日誌與索引狀態變化,再决定是否扩大收口范围。

分頁收錄没有统一答案。先判断價值,再選處理方式,最後用日誌和索引狀態驗證,比一次性關掉所有翻頁要稳妥得多。改動後的變化通常需要一段時間才能在报表上体現,不建议根據一两天的資料下结论。