列表頁和分頁頁是站内 URL 數量最容易失控的一類。一個栏目翻到第 30 頁,就可能多出 29 個地址;再叠加上排序、篩選參數,同一個列表能變出几十種寫法。這些頁面被收錄本身不算坏事,麻烦的是它們稀释了站内連結、占用抓取額度,還容易和真正想被搜到的内容頁抢位置。處理分頁,重点不在「要不要收錄」,而在「哪几頁值得留、剩下的怎么收口」。
一、先把分頁的三種形態分開
不同形態的分頁,抓取路径和收錄表現完全不同,混在一起讨论很容易得出错誤结论。
- 參數分頁:例如列表地址後接 ?page=2。這類地址通常由翻頁連結自然产生,蜘蛛顺着連結一路爬下去,常见問题是頁碼參數被当成可索引内容,生成大量近似重复頁面。
- 路径分頁:例如 /list/page/2/。结构更清晰,适合用序列關系标记或單獨的站点地图来表達,但也因為路径獨立,更容易被單獨收錄甚至參與排名。
- 异步翻頁:点击「加载更多」後由前端追加内容,原始 HTML 里只有第一頁。搜尋引擎可能通過渲染拿到後續内容,也可能完全看不到,取决于具体實現。
二、別急着设不索引,先看這頁有没有用
不少人一發現分頁被收錄,第一反應就是加不索引标记。但這會阻断連結传递,可能導致更深的頁碼彻底失去被發現的机會。更稳妥的判断顺序是:
- 這個分頁上是否只有内容摘要和重复導航?如果是,它大概率没有獨立搜尋價值。
- 分頁是否是站内重要的發現路径?如果是,連結仍然需要被抓取,但不必让這頁參與排名。
- 列表本身是否沉淀了不可替代的信息,比如按時間整理的全量清單、带明确维度的聚合?如果确實有,就不该一刀切處理。
換句话说,「可抓取」和「可索引」是两件事,分頁頁最典型的處理方式就是保留抓取、限制索引。
分頁問题的本质不是重复内容本身,而是連結和權重被摊薄到了大量低價值地址上。
三、按顺序收口的操作步骤
- 先統計規模。用日誌或抓取工具,看分頁 URL 占被抓取地址的比例,再對比索引里分頁頁的實际數量。這一步决定後面要投入多少精力。
- 再看入口。分頁頁的入口通常来自上一頁的翻頁連結。確認這些連結是普通超連結,還是由脚本拼出来的,後者要先解决可抓取性問题。
- 確認規范化寫法。同一组分頁固定用同一種 URL 形式,避免參數、路径、尾斜杠混用,也避免排序、篩選參數和分頁參數搅在一起。
- 决定保留层級。常见做法是保留前几頁,對更深頁碼做收口;或者只让第一頁參與排名,後續頁保留抓取但不索引。
- 检查内容頁入口。分頁頁往往承担着把蜘蛛送進内容頁的任務。收口之前先確認内容頁還有別的入口,比如分類頁、相關推荐、站点地图,否則可能出現内容頁抓取量下降。
- 观察一到两個抓取周期。看索引變化和内容頁的抓取情况,再决定是否繼續收紧。
四、几個容易忽略的点
- 排序參數常和分頁參數同时出現,产生组合膨胀。這類參數建议單獨處理,不要指望分頁方案一並解决。
- 「加载更多」如果只改哈希或只做 DOM 追加,後續内容對蜘蛛可能不可见,此时需要给每頁一個可訪問的獨立地址。
- 分頁頁的标题和摘要如果全部一样,即使被收錄,也很难获得点击,關键分頁可以考虑补充区分度。
- 收口方式改變後,索引不會立刻同步,短時間内看到「没變化」是正常的,不要反复改策略。
總结一句:分頁收錄的核心是把「發現連結」和「參與排名」分開處理。先分清形態,再判断價值,最後按入口、規范、保留层級、内容頁入口的顺序逐步推進,比一上来批量设不索引要稳妥得多。