站点运营

站点运营:分頁與翻頁自查,別让蜘蛛在列表里绕圈

列表頁、标簽頁、归档頁只要内容够多就會分頁,但翻頁地址不统一、越界頁返回 200、無限滚動没有静態入口等問题,會让蜘蛛在同一批 URL 上反复抓取。本文给出一份分頁自查清單,覆盖地址形態、頁碼标题、canonical 與 noindex 取舍,以及如何借助日誌定位最该先改的分頁地址。

站点运营

站点运营:分頁與翻頁自查,別让蜘蛛在列表里绕圈

列表頁、归档頁、标簽頁,只要内容足够多,就一定會出現分頁。分頁本身不是問题,問题在于寫法不统一时,蜘蛛容易在同一個列表里反复绕圈:一會儿抓到 ?page=2,一會儿抓到 /list/2/,中間還夹着空頁和越界頁。這類情况通常不會立刻表現出来,但积累下来會持續消耗抓取资源,也让真正的内容頁排不上队。

分頁為什么值得單獨自查

分頁頁面的數量往往遠大于正文頁。一個只有三百篇内容的站点,如果栏目、标簽、作者頁各有一套分頁,再叠加篩選條件,分頁 URL 很容易上千。這些頁面的标题、描述高度雷同,正文区基本是連結列表,属于典型的结构重复、内容稀薄頁面。当它們還能互相组合出大量排列时,就等于给蜘蛛開了一片没有邊际的草地。

几種常见的問题形態

同一份列表出現多個地址

带參數的 page=1 和不带參數的列表首頁内容完全一样;翻頁用 /page/2/,但頁脚又輸出了 ?paged=2 的舊連結。搜尋引擎會把它們当作不同 URL 分別抓取,權重和抓取配額都被摊薄。自查时最直接的办法是在浏览器里点一遍翻頁,看地址栏的變化是否始终一致。

空分頁與越界分頁

最後一頁之後還能繼續翻,或者把參數随手改成 page=999,頁面依然返回 200 和一片空白。這種頁面既没有内容,又容易在日誌里被反复請求。比較稳妥的做法是让越界請求返回 404,或跳回列表第一頁,而不是稳定地返回一個空壳。

無限滚動與“加载更多”

纯 JS 加载的分頁,蜘蛛可能只看到第一屏。如果站点主要靠無限滚動展示内容,最好同时保留一套可点击、可抓取的分頁連結,或者提供“查看全部”的静態入口。内容能不能被發現,比交互是否顺滑更優先。

“查看全部”頁面

把二十頁内容合成一個長列表,對用戶和抓取都友好,但要注意別让它和分頁頁同时完全開放,否則同一批連結會出現两套入口。選一套作為主入口,另一套做适当收敛即可。

一份可执行的自查清單

  1. 翻頁地址是否只有一種形態,參數與静態路径不要混用。
  2. page=1 是否與列表首頁重复,能否统一到同一個地址。
  3. 分頁頁的标题是否带上頁碼或范围,避免與列表首頁完全相同。
  4. 越界頁碼是否返回 404 或重定向,而不是 200 空頁。
  5. 翻頁按钮是否為可点击的超連結,而不是 onclick 或纯按钮。
  6. 無限滚動是否有對應的静態分頁兜底。
  7. 分頁頁的 canonical 是否指向自身,而不是一律指向列表首頁。
  8. 是否有分頁被誤加 noindex,導致列表深處的頁面失去入口。
  9. 标簽、作者、归档頁的分頁是否纳入同一套規則。
  10. 日誌里分頁 URL 的請求占比是否異常偏高。

處理时的几個取舍

  • 頁碼別寫進标题堆废话。第 2 頁寫“第 2 頁”可以,寫成一大串關鍵詞堆叠就没有必要。
  • 不要一刀切 noindex。分頁頁本身不适合做落地頁,但它是發現内容的重要通道,全部屏蔽等于把入口關掉。
  • 別指望 rel=next/prev。主流搜尋引擎已不再把它当作索引信号,重点還是放在連結可抓取、地址统一這两件事上。
  • 優先處理被抓得最多的分頁。先看日誌里請求量最高的那几條分頁 URL,改動收益最直接。
  • 改完观察一段時間。分頁調整通常不會立刻反映在抓取資料上,按周對比更有意义。
分頁的目标不是让每個頁碼都被收錄,而是让用戶和蜘蛛都能顺着列表走到真正的内容頁。把地址和連結做稳,比追求短期更管用。