分類頁、栏目頁、标簽頁和归档頁通常靠翻頁来展開内容。翻頁是蜘蛛進入深层内容的通道,也是重复地址的高發区。翻頁規則没理顺,抓取會消耗在几十個近似頁面上,真正需要被發現的内容反而迟迟排不上队。
先盘清站内有哪些翻頁
分頁不只出現在分類列表。動手前先列出所有會产生翻頁的位置:
- 栏目與分類列表頁
- 标簽、专题等聚合頁
- 站内搜尋结果頁
- 文章评论的分頁與“加载更多”
- 按時間归档的月份、年份列表
- 商品或资源的篩選结果列表
把它們按重要程度排序:通往核心内容的列表優先梳理,纯聚合、低價值的列表可以合並或收敛。
分頁自查要点
1. 翻頁連結是真實可点的連結
頁碼和“下一頁”應以 a 标簽呈現,href 指向具体地址。只靠 JavaScript 按钮触發、地址不變化的翻頁,蜘蛛往往走不到第二頁之後。同时確認同一頁只有一種地址形式,避免 /list/page/2 與 /list?page=2 两個版本同时存在。
2. 每頁條目數與總頁數
每頁條數太少,頁數被拉長,深层内容离首頁越来越遠;太多則單頁体积大、下载慢。多數站点把每頁控制在 20 到 50 條之間比較折中,並尽量让重要内容在前三到五頁内出現。翻頁到几十頁之後仍無有效内容时,考虑收敛列表口径,而不是繼續加頁。
3. “查看全部”與無限滚動
“查看全部”會生成体积很大的單頁,适合内容量有限的栏目,不适合成千上萬條的分類。無限滚動對用戶友好,但蜘蛛通常不會滚動頁面,需要提供分頁地址作為兜底,或者让首屏之後的内容能通過連結抵達。
4. 分頁的标题與規范地址
翻頁頁面的标题不必與第一頁完全相同,可以带上頁碼或区分词,避免几十個頁面共用同一個标题。關于 canonical:把第二頁之後的翻頁全部指向列表第一頁是一種常见做法,但後續頁面上的内容會因此难以被單獨發現。更稳妥的方式是让翻頁頁面指向自身,或至少不要把全部翻頁压到一個地址上。
5. 翻頁導航是否好用
检查翻頁控件是否包含上一頁、下一頁、頁碼以及目前頁标识;移動端是否還能点到;翻到最後一頁後是否有明确出口。用戶和蜘蛛都需要一條能進能出的路径。
常见誤区
- 列表第一頁存在两個地址,内容相同却没有明确的指向關系。
- 翻頁連結带上一串排序、篩選、追踪參數,同一頁出現多個版本。
- 整站给翻頁頁面加 noindex,却忽略這些頁面上還有指向深层内容的連結。
- 分頁地址由前端路由動態生成,服務器返回的仍是列表第一頁内容。
- 把翻頁内容全部堆到第一頁,用戶和蜘蛛都被長列表淹没。
落地顺序
- 從服務器日誌或站点地图中抽出站内所有翻頁地址,統計數量與层級深度。
- 確認每類列表的目标頁面數量,重新设定每頁條目數。
- 统一翻頁地址格式,清理重复版本與带參數版本。
- 調整翻頁頁面的标题與 canonical 策略,改完抽查几個栏目做對比。
- 在搜尋资源平台的抓取統計里观察翻頁地址占比是否下降。
翻頁不是越多越好,也不是全部挡住就省事。它是一條通道:把蜘蛛顺利送到内容頁,同时別让它在同一個列表里反复打轉。
分頁自查不必一次改完。先挑一個内容最多的栏目做试点,观察抓取分布和收錄情况,再逐步推廣到其他列表。改動前後留一份记錄,方便日後回溯是哪次調整带来了變化。