分頁是站内最容易被忽略的抓取路径。首頁和栏目頁通常會被反复抓取,但列表翻頁之後的部分,往往因為連結形態、URL 结构和入口數量的問题,慢慢從蜘蛛的视野里淡出。
分頁在抓取路径里是什么位置
對一個内容站点来说,列表頁承担的是“發散”职责:它把一批詳情頁的 URL 摆到蜘蛛面前。第 1 頁通常有多個入口,比如首頁推荐、栏目導航、Sitemap;越往後入口越少,被抓取的频率也随之下降。這本身不一定是問题,如果深层頁碼上的内容本来就不重要。但如果你的老文章只靠翻頁才能被重新發現,那這條翻頁路径就断不得。
让分頁連結是“能被抓的連結”
很多列表頁的翻頁是前端渲染的:点击“下一頁”只是改了頁面狀態,HTML 里没有可抓取的 href。蜘蛛不点击按钮,它解析的是 HTML 里的 a 标簽。對于能执行 JS 的蜘蛛,渲染後的連結也可能進入队列,但成本和不确定性都更高。
几個基本做法
- 頁碼和上一頁/下一頁用真實的 a 标簽輸出,服務端渲染,或至少在首屏 HTML 里带出来。
- 不要只用 button 或 div 绑定点击事件来承担翻頁。
- “下一頁”這類的稳定連結,價值通常高于只放一個“跳轉到第 N 頁”的輸入框。
分頁 URL 的两種寫法
路径型:/list/page/2/
结构清晰,便于統計,也方便在服務器日誌里按前缀篩選。代價是每翻一頁就多一個可索引 URL,需要提前想清楚這些頁面在索引里的定位。
參數型:/list?page=2
更容易出問题。如果參數顺序、大小寫、追踪參數混在一起,同一個分頁可能對應多個地址,蜘蛛要在几個 URL 之間来回確認。建议對分頁參數保持固定顺序,並處理好它與篩選參數的组合關系。
另外要提醒一句:不要用 robots.txt 去拦截分頁路径。這會直接切断翻頁鏈條,让後面的詳情頁失去這條發現路径。如果只是不想让分頁頁出現在搜尋结果里,用 noindex 比用 robots.txt 更合适,因為 noindex 不阻止蜘蛛繼續沿連結往下走。
深层頁碼需要額外入口
常規分頁往往只放出前後几頁和首尾頁,第 30 頁往後几乎没有連結指向。這时候可以在结构上补几條路径:
- 按月份、按年份的归档頁,作為時間维度的入口。
- 按标簽或分類聚合的列表,作為主题维度的入口。
- 在 Sitemap 里分片提交詳情頁 URL,不完全依赖翻頁。
這些入口的作用不是提升排名,而是保證 URL 在需要被重新抓取时有一條可達的路径。
最後一頁別做成死路
列表翻到最後,“下一頁”消失是正常現象,但頁面不應只剩一堆條目。這一頁仍要保留正常的栏目導航和内鏈,让蜘蛛從這里能回到栏目或找到其他入口,避免出現只顯示空狀態提示的頁面。
怎么自查分頁路径
- 關掉 JS,看列表頁 HTML 里有没有完整的分頁連結。
- 從第 1 頁顺連結点到第 10 頁,確認每一步都有 a 标簽可走。
- 检查分頁 URL 是否被 robots.txt 誤拦。
- 在服務器日誌里按分頁路径前缀篩選,看蜘蛛有没有真正走到深层頁碼。
分頁本身不产生排名,它决定的是詳情頁有没有被發現的路径。路径不断、URL 干净、深层有入口,這三件事比翻頁的样式更重要。