先分清三種分頁,處理方式完全不同
讨论分頁收錄之前,先给頁面定性。同一個站点上,带着“第 N 頁”的 URL 至少有三類:
- 内容分頁:一篇文章被切成多頁,每頁都承载正文的一部分。
- 列表分頁:栏目、标簽、搜尋结果的翻頁,主要作用是提供更多條目的入口。
- 篩選组合分頁:排序、價格区間、地区等參數叠加产生的 URL。
三類頁面的检索價值差別很大,混在一起處理,很容易出現该收的没收、不该收的收了一堆。
第 N 頁有没有獨立检索價值
内容分頁
每頁都有獨立正文,用戶的搜尋需求也可能落在第 2、3 頁上,比如清單類内容的後續條目。這類頁面一般按獨立頁面處理:标题带上頁碼或小标题,canonical 指向自己,並保證第一頁到後續頁之間有可点击的連結。
列表分頁
價值随頁數递减。第 5 頁之後通常只是入口集合,用戶很少直接搜尋到它。這里的核心不是“必须收錄”,而是不要挡住它後面條目的發現路径。可以保留可抓取,同时不必强求進入索引。
篩選组合分頁
先把參數分類:影响内容集合的,比如地区、品類,尽量做成静態路径;只影响排序和展示的,比如 sort、view,集中收敛,避免無限组合。
核對顺序:從抓取到收敛
- 抓取层:確認第一頁能否通過普通可点击連結到達後續頁,而不是只靠 JS 按钮或滚動加载。
- 索引层:用站点查询和索引覆盖报告,列出實际進入索引的分頁 URL,按上面三類归類。
- 内容层:抽查第 2、3 頁的标题與描述是否和第一頁重复。如果完全一样,索引里出現替身是必然的。
- 指向层:確認 canonical 指向的是自己還是第一頁。指向第一頁,等于告诉搜尋引擎把權重和展示都归到第一頁,深頁基本不會被保留。
- 收敛层:确定哪些分頁保留入口、哪些标 noindex、哪些走參數收敛。注意 noindex 只影响索引,不影响抓取,路径仍然要通。
几個容易踩的坑
- 把所有分頁统一 canonical 到第一頁,结果第 2 頁之後的條目失去被發現的机會。
- 用 noindex 關閉分頁,同时又依赖這些頁面把新條目带出去。
- 分頁 URL 里混入會话 ID、時間戳等無關參數,同一頁出現十几個版本。
- 只检查第一頁,没有抽查第 2、3 頁的标题和正文模板。
分頁收錄的關键不是把每一頁都收進来,而是让该有入口的頁面保持可發現,让只是翻頁的頁面不占用索引和抓取资源。
落地建议
先做一份分頁 URL 清單,按三類打标,再针對每一類确定 canonical、noindex 和參數處理規則。改動後结合抓取日誌與索引覆盖报告观察两到四周,重点看新條目被發現的速度有没有變慢,再决定是否調整收敛力度。