列表頁翻到第 20 頁也被收錄,很多人第一反應是“重复内容太多”。但在動手之前,先分清一件事:分頁被收錄,可能是负担,也可能是長尾入口。處理方式不同,结果差別很大。
先判断分頁有没有獨立價值
分頁 URL 和第一頁相比,差异通常只有列表項和排序。判断是否值得保留收錄,可以問三個問题:
- 列表項本身是否有检索價值?比如商品、房源、职位這類有明确搜尋需求的條目。
- 翻到後面的頁面,是否還會出現在站内導航或内鏈中?如果只有“下一頁”按钮能到達,實际分發價值有限。
- 用戶是否可能直接搜尋到這一頁?如果答案基本是否定的,收錄的意义就不大。
分頁的收錄决策,本质是先判断内容價值,再决定技術處理,而不是反過来。
三種常见處理方式,先想清楚代價
一、放開收錄
适合列表項有獨立搜尋需求的站点。前提是分頁 URL 稳定、可抓取,並且每頁有自己的标题與 H1,canonical 自指。否則同一個序列容易出現多個版本互相竞争。
二、canonical 指向第一頁
這會让搜尋引擎倾向于只保留第一頁,但也會连带削弱翻頁頁面上列表項作為入口的價值。如果站点依赖列表頁做内鏈分發,這個操作要谨慎。
三、noindex, follow
頁面不進入索引,但頁面上的連結仍會被跟随。适合“只想要連結分發、不想要頁面本身”的场景。注意 noindex 需要在頁面被抓取到的前提下才生效,如果同时用 robots.txt 屏蔽了该路径,两邊的指令會互相抵消。
核對抓取路径,別让深翻頁吃掉预算
很多站点的翻頁是無限延伸的,“下一頁”可以一路点到几百頁。這類路径的問题不在于收錄本身,而在于蜘蛛會把大量時間花在低價值頁面上,内容頁的重訪频率因此被拉低。
- 看抓取日誌中翻頁 URL 的占比,如果明顯高于内容頁,說明路径過深。
- 检查是否存在按頁碼批量生成的入口,比如把全部翻頁塞進了 sitemap。
- 考虑對超過一定頁數的翻頁做收口,保留前面若干頁可抓取。
翻頁顺序變了,索引也會抖
如果列表按時間或热度排序,翻頁内容會不断變化,同一個 URL 今天對應 A 组列表項,明天可能完全不同。搜尋引擎每次看到的版本都在變,索引狀態就容易波動。如果希望收錄相對稳定,可以考虑让分頁顺序固定下来,或對排序參數做規范化處理。
索引报表里要看的狀態
處理之後不要只看“收錄數量變了多少”,還要看狀態归類:
- 被選為規范頁的是第一頁,還是某個翻頁。
- “已抓取,尚未编入索引”是否集中出現在翻頁 URL 上。
- 同一分頁序列是否有多個版本同时被索引。
- 排除原因是否為“重复,未選擇規范頁”或“已被 noindex 标记排除”。
一份可执行的核對清單
- 確認分頁 URL 是否稳定,有没有混入篩選、排序、追踪參數。
- 確認翻頁頁面上的列表項連結能被抓取,而不是依赖脚本执行後才出現。
- 確認 noindex、canonical、robots.txt 三者的指令不冲突。
- 確認站点地图里没有包含不必要的翻頁地址。
- 观察 2 到 4 周的抓取日誌與索引狀態變化,再决定是否扩大收口范围。
分頁收錄没有统一答案。先判断價值,再選處理方式,最後用日誌和索引狀態驗證,比一次性關掉所有翻頁要稳妥得多。改動後的變化通常需要一段時間才能在报表上体現,不建议根據一两天的資料下结论。