站点运营

站点运营:分頁與翻頁自查,別让列表頁挡住新内容的路

列表頁的翻頁連結是站内新内容被發現的重要通道之一。本文梳理分頁常见的几類問题,包括翻頁依赖脚本、路径與參數混用、規則誤屏蔽、翻頁层級過深等,並给出一份可以直接照着做的自查清單,帮助你把栏目頁、归档頁的翻頁结构整理清楚,让老内容也有被重新訪問的机會。

站点运营

站点运营:分頁與翻頁自查,別让列表頁挡住新内容的路

栏目頁、标簽頁、归档頁是站内新内容被發現的主要入口。這些頁面通常靠翻頁把歷史内容一頁頁铺開,如果分頁這一环出了問题,蜘蛛往往只抓到第一頁的十几條連結,後面的内容就只能靠 Sitemap 和内鏈碰运气。

分頁為什么會影响 URL 發現

蜘蛛的抓取是有预算的。它進入一個列表頁後,會沿着頁面上的連結繼續走。分頁連結如果存在且可点,它就能顺着翻到第二頁、第三頁;如果分頁連結是按钮、是脚本生成、是异步加载出来的,那么對蜘蛛来说,這一頁就是终点。時間一長,越老的内容越难被重新訪問,更新過的舊文章也可能長期停留在舊版本上。

常见的几類分頁問题

翻頁連結依赖脚本

“加载更多”按钮通過点击事件請求接口並把结果插入頁面,這種寫法對用戶很顺手,但連結没有出現在初始 HTML 里。可以给按钮加一個普通的 a 标簽作為回退,指向带頁碼的地址,让不支持脚本的訪問者也能翻頁。

路径與參數混用

同一個列表既能用 /list/page/2/ 訪問,也能用 /list/?p=2 訪問,两套地址各自被抓,就容易出現重复内容。挑一種作為标准,另一種用 301 指過去,或者干脆不产生。

分頁被規則挡住

有些人担心翻頁太多浪費抓取,就在 robots.txt 里屏蔽带 page 的地址,或者给分頁加上 noindex。屏蔽之後,蜘蛛同样無法沿着這些連結往下走,代價是新内容發現變慢。如果只是不想让分頁參與排名,用 noindex,follow 更合适,同时確認 canonical 指向自身而不是第一頁。

翻頁數量過多

一個栏目如果分成上百頁,後面几十頁可能長期無人訪問。可以考虑限制可见翻頁范围,同时用 Sitemap 或专题頁把老内容重新组织成可發現的入口。

自查清單

  1. 打開栏目頁的源代碼,確認翻頁連結是 a 标簽,且 href 里有真實地址。
  2. 用禁用脚本的方式看一眼頁面,是否還能走到第二頁。
  3. 检查分頁地址是否只有一種形式,尾斜杠、大小寫、參數顺序是否统一。
  4. 查看分頁頁面的 canonical,是否指向自身,而不是全部指向第一頁。
  5. 確認分頁的 meta robots 没有誤用 noindex,nofollow。
  6. 翻到最後一頁,看是否存在空白頁、重复的第一頁内容或 404。
  7. 排序參數(按時間、按热度)是否产生了大量内容相同的地址。
  8. 在訪問日誌里搜一下翻頁地址的抓取记錄,看蜘蛛實际走到了第几頁。

處理时的几個原則

  • 優先保證可達:先让連結能被抓到,再谈要不要让它參與排名。
  • 一個地址一種形式:分頁地址越規整,重复内容的排查成本越低。
  • 给老内容留入口:除了翻頁,也可以用分類聚合、相關推荐、Sitemap 分担發現任務。
  • 改動後回看日誌:調整了分頁结构,隔一段時間看看蜘蛛的抓取路径有没有跟着變化。
分頁不是靠堆頁碼来讨好蜘蛛,而是把已有的内容组织成一條能被走通的路。

這類检查不需要多复杂的工具,打開頁面看源碼、亲手翻几頁、再翻翻訪問日誌,多數問题就能暴露出来。發現一處改一處,比一次性大改模板更稳妥。