站点运营

站点运营:分頁自查,別让列表頁在翻頁里打轉

列表頁翻頁平时没人细看,却可能吃掉大量抓取配額。本文梳理分頁常见的五個問题:翻頁靠 JS 抓不到連結、标题描述頁頁重复、canonical 全指向第一頁、無限滚動没有獨立 URL、组合參數生成空頁面,並给出一份可以照着做的自查清單和几個取舍建议。

站点运营

站点运营:分頁自查,別让列表頁在翻頁里打轉

很多站点的列表頁翻頁是自動生成的,平时没人细看,出問题时也不容易察觉。文章列表、产品分類、标簽匯總、搜尋结果,這些頁面往往會生成成百上千個分頁 URL。如果處理不当,蜘蛛會把大量抓取配額花在翻頁上,真正的内容頁反而被挤到後面。

分頁最常见的几個坑

1. 翻頁靠 JS 渲染,連結抓不到

「下一頁」按钮如果只是绑定了一個点击事件,没有可訪問的 href,蜘蛛顺着連結走不動,第二頁之後的内容基本等于不存在。自查方式很简單:把頁面 HTML 源碼里的 a 标簽筛一遍,看有没有指向第二頁的真實連結。

2. 所有分頁共用同一個标题

第 1 頁到第 20 頁标题都是「行业资讯_某某網」,描述也一字不差。這會让搜尋引擎难以判断每頁的差异,也容易造成同质化。建议标题里带上頁碼或该頁實际覆盖的内容区間,但不要机械地堆砌數字。

3. 把分頁的規范連結全部指向第一頁

這是比較常见的做法,但代價是第 2 頁之後的 URL 很难被單獨索引,上面的内容也失去了被發現的机會。更稳妥的是每頁自指,让每個分頁 URL 對自己的内容负责。

4. 「加载更多」和無限滚動没有留退路

無限滚動体驗流畅,但頁面 URL 從头到尾不變,新加载的内容没有獨立地址。可以在滚動加载的同时更新地址栏參數,或者提供一個「查看全部」的静態分頁入口,保證内容有可抓取的路径。

5. 组合參數生成大量空分頁

排序、篩選、分頁三個參數一叠加,很容易出現内容重复甚至為空的頁面。這類 URL 建议用 robots.txt 或參數處理規則挡掉一部分,避免蜘蛛在空頁面上反复兜圈。

一份可以照着做的自查清單

  1. 關掉 JS,检查分頁連結是否還能点击、是否還有 href。
  2. 抽查前 5 頁的 title 和 description,看是否完全重复。
  3. 检查 canonical 是自指還是统一指向第一頁,確認這是有意為之。
  4. 用日誌或抓取工具統計分頁 URL 的抓取次數占比,超過内容頁就需要注意。
  5. 確認每個内容頁至少有一條不依赖翻頁的入口,比如分類首頁、相關推荐、站点地图。
  6. 检查空结果頁、越界頁碼是否返回 404,還是返回 200 的空壳頁面。

處理时的几個取舍

分頁本身不是問题,問题是分頁把抓取预算吃光、把内容頁埋掉。几個相對稳妥的做法:

  • 保留可訪問的静態 URL:翻頁連結寫成标准連結,而不是按钮加事件。
  • 每頁自指 canonical:除非確認這些分頁没有獨立價值,否則不要全指向第一頁。
  • 控制分頁深度:深處頁碼的抓取價值很低,可以在保留用戶入口的前提下减少暴露。
  • 内容頁優先:让每個内容頁都有獨立、稳定的入口,而不是只能靠翻頁找到。
翻頁是给用戶用的,不是给蜘蛛堆頁面的。分頁做得越简單直接,抓取路径就越清晰。

怎么判断有没有改善

調整之後,可以观察两件事:一是服務器日誌里内容頁與分頁頁的抓取比例是否變化;二是新發布的内容能否較快通過分類頁入口被抓到。這些指标不會立刻變化,通常需要观察几周。SEO 没有一改就灵的操作,把结构理顺,收益是慢慢体現的。