很多站点运营者盯首頁、盯栏目頁、盯 Sitemap,却很少检查列表頁的分頁。實际上,對内容型站点来说,蜘蛛能持續發現半年前、一年前的老文章,主要靠的就是列表頁一頁頁往下翻。分頁鏈路断了,新内容照常被抓,但存量 URL 會慢慢從抓取队列里消失,日誌里表現為老頁面的抓取频次一路下滑。
列表頁承担了大部分 URL 發現工作
Sitemap 提供的是候選清單,内鏈提供的是路径。蜘蛛顺着首頁進入栏目,再顺着栏目列表進入詳情頁,這條鏈路是它最熟悉、也最愿意反复走的。分頁連結是這條鏈路的延長线:第一頁之後的内容,往往只能通過它繼續被發現。
所以判断一個站点的抓取是否健康,可以先看两件事:列表頁上的詳情連結是不是纯 HTML 可讀;分頁連結能不能在不做任何交互的情况下被讀到。
分頁寫法的几種常见問题
只在点击後才出現的分頁
移動端常见的「加载更多」或無限滚動,初始 HTML 里往往没有任何下一頁連結。蜘蛛不會去点按钮,也就走不到第二頁往後。可行做法是保留一個静態的分頁連結,或者至少给出進入更深层列表的入口,让不执行 JS 的抓取也能繼續往下走。
分頁被 robots.txt 或频控挡住
有些站点為了避免重复内容,直接在 robots.txt 里屏蔽带 page 參數的地址。结果是詳情頁本身還能從別處被發現,但沿着分頁往下走的路径被切断了。屏蔽前最好先確認一件事:這條 Disallow 挡掉的只是分頁頁,還是连带挡掉了篩選頁、标簽頁里的詳情連結。
分頁頁被 noindex 或 canonical 指回第一頁
分頁頁不參與索引通常没問题,它本来就不是用来排名的。但要注意区分「不索引」和「不抓取」:noindex 的頁面蜘蛛仍會来抓,分頁連結依然可以通行。真正有影响的是把分頁做成需要交互才能進入,或者让翻頁地址根本不出現在任何 HTML 里。canonical 指回第一頁时,重点看它是否同时把連結也一起改掉了。
分頁本身也會消耗抓取资源
如果一個列表頁動辄列出上百條,每頁還要加载大量图片和脚本,蜘蛛單位時間能走完的分頁數就會下降,深层的存量内容自然排到後面。列表頁保持轻一点,把详细信息留给詳情頁,對抓取效率更友好。翻頁數量也不要人為收得太紧,「一共两百頁却只放出十頁」會让後面的内容彻底失去入口。
一份可以照着做的自查清單
- 禁用 JS 後打開列表頁,確認分頁連結仍然存在且可点击。
- 用抓取日誌核對:第二頁之後的 URL 是否還有蜘蛛訪問记錄。
- 检查 robots.txt,確認没有把翻頁參數整体屏蔽。
- 確認分頁連結带的是可讀 URL,而不是 onclick 事件或空 href。
- 控制列表頁首屏 HTML 体积,减少不必要的内联脚本。
- 老内容如果只剩 Sitemap 一個入口,考虑在相關推荐、标簽頁里补上内鏈。
分頁不是给人看的装饰,它是蜘蛛進入存量内容的楼梯。楼梯断在哪里,抓取就停在哪里。
分頁鏈路的問题通常不會立刻顯現,它更像慢性失血:首頁和最新文章一切正常,只有翻日誌才會發現老 URL 的抓取越来越少。定期检查一遍從列表頁到深层頁的路径,比事後追着抓取異常找原因要省力得多。