網站收錄

分頁頁面的收錄處理:翻頁 URL、canonical 與“加载更多”

列表翻頁该不该進索引,取决于詳情頁規模、翻頁深度和頁面自身價值。本文按三種翻頁形態拆開讲:獨立分頁 URL、加载更多和無限滚動,分別說明 canonical 指向、robots.txt 屏蔽造成的冲突,以及怎样留出可抓取路径,最後给出一份可执行的检查清單。

網站收錄

分頁頁面的收錄處理:翻頁 URL、canonical 與“加载更多”

列表頁翻到第 3 頁、第 10 頁,這些 URL 要不要進索引,是收錄环节里绕不開的問题。處理方式没有统一答案,取决于詳情頁總量、翻頁深度,以及這些頁面本身有没有獨立價值。先看清翻頁是怎么實現的,再决定怎么處理,顺序會顺很多。

翻頁 URL 的三種形態

同样是“下一頁”,背後的 URL 行為差別很大:

  • 獨立 URL 分頁:形如 /list/page/3 或 /list?page=3,每個翻頁頁有可点击的連結,抓取程序能顺着走。
  • 加载更多:按钮触發异步請求,地址栏不變。如果頁面里没有對應的静態連結,翻頁内容通常不會被單獨發現。
  • 無限滚動:滚動到底部才繼續取資料。除非用 History API 同步地址,否則没有可供引用的獨立 URL。

三種形態的收錄策略不一样,但判断起点相同:這個 URL 是不是一個可以被單獨描述、單獨指向的頁面。

哪些翻頁頁值得進索引

可以落在一個問题上:這一頁除了首頁已经出現的條目,是否還提供了新的連結集合,並且這些連結有被單獨引用的场景。常见的几種情况:

  • 詳情頁量大、翻頁很深:靠後的頁面基本只是連結列表,和前面高度相似,一般不必强求收錄。
  • 列表本身就是内容,比如归档頁、专题頁、分類精選:這類頁面有獨立價值,可以允许收錄。
  • 站点体量小,翻頁只有两三頁:全部放開通常問题不大,管理成本也低。

不必把每一頁都当成必争之地,重点是同一套規則要前後一致,不要今天放開、明天又全部挡掉。

canonical 別指向一個不相干的頁面

把第 2 頁之後的 canonical 全部指向第 1 頁,是很常见但容易出問题的做法。這等于告诉搜尋引擎“這些内容都是第 1 頁的副本”,後續翻頁自然不會作為獨立頁面處理。如果你确實希望翻頁頁有机會被單獨收錄,canonical 應当自指。

反過来说,如果已经决定不收,也要選一種手段贯穿到底:用自指 canonical 配合不收錄策略,或者用頁面上的 noindex,但两者不要同时指向不同结论。

robots.txt 屏蔽翻頁參數时要留意

一個容易被忽略的组合是:先用 robots.txt 挡掉带 ?page= 的地址,又在頁面上寫了 noindex。抓取程序根本取不到那個頁面,也就讀不到 noindex,两套指令就互相打架了。想靠頁面級指令控制索引,前提是這一頁還能被抓到。

加载更多與無限滚動怎么留出可抓取路径

  • 在 HTML 里保留一套真實的分頁連結,放在列表底部,不要只靠脚本生成。
  • 用 History API 把地址栏同步成唯一 URL,让每一屏内容都有對應地址。
  • 分頁連結使用真正的 a 标簽,避免只用点击事件绑定跳轉。

這三点並不需要多复杂,只是保證“有内容、也有路径”。路径断了,後面再谈收錄就没有基础。

一份可执行的检查清單

  1. 確認翻頁 URL 唯一且稳定,避免同一頁出現參數顺序不同的多個版本。
  2. 在不执行脚本的情况下检查第 2、3 頁,確認能否拿到下一頁連結。
  3. 先定下哪些翻頁頁進索引,再统一执行 canonical 與頁面級指令。
  4. 核對 robots.txt,看有没有誤挡分頁參數,導致頁面級指令失效。
  5. 抽查几個翻頁頁的抓取與索引狀態,观察一段時間後再調整,別频繁改規則。
分頁的關键不是“要不要收”,而是让每個 URL 的角色清楚:能被抓到、指向明确、不和相邻頁面互相打架。

把翻頁当成一套需要長期维護的規則,而不是一次性的開關,後續新增列表模板时,沿用同一套判断就好。