列表頁、标簽頁、搜尋结果頁一旦带上分頁,URL 數量很容易從几十條變成几千條。蜘蛛會沿着“下一頁”一路爬,但抓到和收進索引是两件事。分頁處理的目标不是让每個頁碼都被收錄,而是让蜘蛛把訪問机會花在真正有獨立價值的頁面上。
先分清抓取分頁和收錄分頁
蜘蛛抓取分頁,通常只是為了發現更深层的内容。比如商品列表第 5 頁,它可能只是通往第 50 個商品的路径。如果這個頁碼本身没有獨立搜尋需求,也没有稳定的内容差异,那么它被抓取是正常的,不被收錄也正常。
反過来,如果分頁地址被大量收錄,而内容與第一頁高度相似,就可能出現重复内容、索引膨胀,甚至让真正重要的詳情頁在抓取预算里被挤到後面。處理分頁时,先判断頁面属于“路径”還是“内容”。
哪些分頁值得進入索引
列表首頁通常值得保留
分類列表的第一頁往往是频道入口,有明确的主题词和稳定的内容集合。它适合被收錄,也适合作為内鏈枢纽,把權重和抓取路径传给詳情頁。
後續頁碼多數不必强求收錄
第 2 頁之後的列表,内容通常是前頁内容的延續或重复组合。除非该頁碼有獨立搜尋需求,比如“某品類排行榜第 2 頁”這種极少见情况,否則不建议把它当作獨立落地頁去優化。让它可被抓取、可發現詳情頁即可。
带篩選參數的分頁要單獨判断
篩選條件组合出的 URL,數量可能指數增長。如果篩選结果本身有稳定内容,且用戶會直接搜尋這類组合,可以考虑保留少數高價值组合;其余组合頁更适合收口,避免蜘蛛在參數迷宫里消耗预算。
分頁 URL 的常见寫法和收口方式
- 路径式分頁:如 /list/page/2/。结构清晰,容易判断頁碼层級,适合保留可抓取路径,但後續頁碼通常不必全部收錄。
- 參數式分頁:如 ?page=2。容易和篩選參數混在一起,建议固定參數顺序,避免同一頁因參數顺序不同产生多個地址。
- 無限滚動或按钮加载:内容由 JavaScript 追加,蜘蛛可能只看到第一屏。需要提供可抓取的分頁連結,或至少保證首屏 HTML 里有進入詳情頁的連結。
- “查看全部”頁面:如果能把多頁内容合並到一個長頁面,通常比保留几十個分頁更利于收錄和维護,但頁面体积和加载速度要控制。
给蜘蛛一條清晰的路
分頁之間用普通的可抓取連結连接,不要只依赖 JavaScript 点击事件。第一頁指向第二頁,第二頁指向第三頁,同时提供返回第一頁的入口。這样蜘蛛能按顺序發現内容,也能判断分頁的层次。
關于 rel=next 和 rel=prev,主流搜尋引擎已经不再把它当作收錄指令。它可以作為辅助信号,但不能替代清晰的連結结构和 canonical 判断。不要指望靠一個标簽解决分頁重复問题。
對于不希望被收錄的後續頁碼,可以在頁面上使用 noindex,但要確認蜘蛛仍能通過该頁發現詳情頁連結。如果頁面被 noindex 後又切断了内鏈,詳情頁可能一起失去入口。
自查顺序
- 導出被收錄的分頁 URL,按頁碼和參數分组,看哪些是列表首頁,哪些是後續頁或篩選组合。
- 抽查被收錄的後續頁碼,對比它與第一頁的标题、正文和商品集合,判断是否有獨立價值。
- 检查分頁連結是否為可抓取連結,還是只在 JavaScript 里绑定点击事件。
- 核對 canonical:分頁應指向自身還是第一頁,取决于你想让哪個版本進入索引,不要全站统一寫死。
- 用服務器日誌观察蜘蛛訪問分頁的频率和深度,確認抓取预算是否被低價值頁碼占用。
分頁收錄没有统一答案。列表首頁通常值得保留,後續頁碼多數只需承担“被發現”的职责。先明确每個頁碼的角色,再决定是否让它進入索引,比盲目提交或屏蔽更稳妥。
最後提醒一句:分頁處理的目标是让蜘蛛高效發現詳情頁,同时避免重复地址稀释站点结构。做完調整後,观察日誌和索引报告的變化需要時間,不要因為一两天没有動静就反复改動規則。