列表頁、搜尋结果頁、商品列表的分頁 URL,是收錄問题里很容易被忽略的一块。有人希望所有分頁都被收錄,有人干脆全挡住。两種做法都有代價,關键在于分頁上的内容對用戶是否真的存在獨立價值。
分頁為什么容易被当成重复内容
第 2 頁的标题、副标题、描述经常和第 1 頁一模一样,只有條目列表不同。判断时搜尋引擎會看整頁的文本构成:如果除了几條新條目,其余头部、侧栏、底部推荐完全一致,它很容易被归到近似重复的一類。
- 标题與 meta 描述完全沿用第 1 頁,没有任何区分
- 第 2 頁的條目,在第 1 頁的推荐位或侧栏里也出現過
- 分頁序列没有可爬取的連結,只剩一個 JS 按钮
三種分頁實現,抓取表現不一样
传统連結分頁
每一頁都有真實的 a 标簽指向下一頁,抓取路径最清晰。代價是頁面數量多,靠後的分頁容易被当成低價值内容。
加载更多與無限滚動
如果“加载更多”是通過請求拉資料再插入頁面,蜘蛛拿到的初始 HTML 里可能只有第一屏。没有可点击的連結,後面的内容就很难被發現。稳妥的做法是保留一套可跳轉的連結,哪怕它放在頁面底部不那么顯眼的位置。
分頁叠加篩選參數
分頁和篩選條件叠在一起时,URL 數量會成倍增長。這類组合頁面的收錄價值通常偏低,還容易稀释整站的抓取预算。常见的處理是让主要分頁保持可抓取,把篩選组合收敛成少數几個真正有搜尋需求的入口。
判断要不要收錄的几條參考
- 用戶很少會搜“第 5 頁”,但會搜第 5 頁里的某個具体條目,那些條目應该由詳情頁来承载
- 第 2 頁之後是否還有獨有文案、獨有分類說明?有,收錄價值就高一些
- 分頁是否會因為库存變化频繁出現或消失?變動越频繁,索引越不稳定
- 站点規模:几百個分頁可以放,上百萬個分頁通常要收着放
自查顺序
- 查看分頁 URL 返回的初始 HTML 里,有没有指向下一頁的連結
- 核對分頁的标题與描述,是否與第 1 頁完全重复
- 在服務器日誌里看搜尋引擎實际抓了多少分頁,占比是否異常
- 抽查几個分頁在索引里的落地版本,是否落到了第 1 頁或某個篩選頁
- 再决定這批分頁是保留、收敛,還是加 noindex
分頁本身不是問题,“每一頁都長得一样還都想被收錄”才是問题。
小结
分頁 URL 的處理没有统一答案。比較可靠的做法是:让詳情頁承担收錄任務,让列表頁承担發現任務;分頁保留可抓取的連結路径,但不必强求全部進索引。当發現分頁大量被索引、而詳情頁迟迟不進的时候,通常說明抓取预算被低價值頁面占住了,這时该回头看看列表和分頁的開放程度是否合理。