列表頁、归档頁、标簽頁,只要内容足够多,就一定會出現分頁。分頁本身不是問题,問题在于寫法不统一时,蜘蛛容易在同一個列表里反复绕圈:一會儿抓到 ?page=2,一會儿抓到 /list/2/,中間還夹着空頁和越界頁。這類情况通常不會立刻表現出来,但积累下来會持續消耗抓取资源,也让真正的内容頁排不上队。
分頁為什么值得單獨自查
分頁頁面的數量往往遠大于正文頁。一個只有三百篇内容的站点,如果栏目、标簽、作者頁各有一套分頁,再叠加篩選條件,分頁 URL 很容易上千。這些頁面的标题、描述高度雷同,正文区基本是連結列表,属于典型的结构重复、内容稀薄頁面。当它們還能互相组合出大量排列时,就等于给蜘蛛開了一片没有邊际的草地。
几種常见的問题形態
同一份列表出現多個地址
带參數的 page=1 和不带參數的列表首頁内容完全一样;翻頁用 /page/2/,但頁脚又輸出了 ?paged=2 的舊連結。搜尋引擎會把它們当作不同 URL 分別抓取,權重和抓取配額都被摊薄。自查时最直接的办法是在浏览器里点一遍翻頁,看地址栏的變化是否始终一致。
空分頁與越界分頁
最後一頁之後還能繼續翻,或者把參數随手改成 page=999,頁面依然返回 200 和一片空白。這種頁面既没有内容,又容易在日誌里被反复請求。比較稳妥的做法是让越界請求返回 404,或跳回列表第一頁,而不是稳定地返回一個空壳。
無限滚動與“加载更多”
纯 JS 加载的分頁,蜘蛛可能只看到第一屏。如果站点主要靠無限滚動展示内容,最好同时保留一套可点击、可抓取的分頁連結,或者提供“查看全部”的静態入口。内容能不能被發現,比交互是否顺滑更優先。
“查看全部”頁面
把二十頁内容合成一個長列表,對用戶和抓取都友好,但要注意別让它和分頁頁同时完全開放,否則同一批連結會出現两套入口。選一套作為主入口,另一套做适当收敛即可。
一份可执行的自查清單
- 翻頁地址是否只有一種形態,參數與静態路径不要混用。
- page=1 是否與列表首頁重复,能否统一到同一個地址。
- 分頁頁的标题是否带上頁碼或范围,避免與列表首頁完全相同。
- 越界頁碼是否返回 404 或重定向,而不是 200 空頁。
- 翻頁按钮是否為可点击的超連結,而不是 onclick 或纯按钮。
- 無限滚動是否有對應的静態分頁兜底。
- 分頁頁的 canonical 是否指向自身,而不是一律指向列表首頁。
- 是否有分頁被誤加 noindex,導致列表深處的頁面失去入口。
- 标簽、作者、归档頁的分頁是否纳入同一套規則。
- 日誌里分頁 URL 的請求占比是否異常偏高。
處理时的几個取舍
- 頁碼別寫進标题堆废话。第 2 頁寫“第 2 頁”可以,寫成一大串關鍵詞堆叠就没有必要。
- 不要一刀切 noindex。分頁頁本身不适合做落地頁,但它是發現内容的重要通道,全部屏蔽等于把入口關掉。
- 別指望 rel=next/prev。主流搜尋引擎已不再把它当作索引信号,重点還是放在連結可抓取、地址统一這两件事上。
- 優先處理被抓得最多的分頁。先看日誌里請求量最高的那几條分頁 URL,改動收益最直接。
- 改完观察一段時間。分頁調整通常不會立刻反映在抓取資料上,按周對比更有意义。
分頁的目标不是让每個頁碼都被收錄,而是让用戶和蜘蛛都能顺着列表走到真正的内容頁。把地址和連結做稳,比追求短期更管用。