搜尋抓取

分頁連結與蜘蛛路径:列表頁翻不動,老内容容易被漏抓

列表頁分頁是蜘蛛發現存量内容的主要通道,但不少站点的翻頁靠点击加载、被 robots 挡住,或者列表頁過重,導致抓取路径走到一半就断了。本文梳理分頁連結的常见寫法問题、noindex 與分頁的關系,以及一份可以照着做的自查清單。

搜尋抓取

分頁連結與蜘蛛路径:列表頁翻不動,老内容容易被漏抓

很多站点运营者盯首頁、盯栏目頁、盯 Sitemap,却很少检查列表頁的分頁。實际上,對内容型站点来说,蜘蛛能持續發現半年前、一年前的老文章,主要靠的就是列表頁一頁頁往下翻。分頁鏈路断了,新内容照常被抓,但存量 URL 會慢慢從抓取队列里消失,日誌里表現為老頁面的抓取频次一路下滑。

列表頁承担了大部分 URL 發現工作

Sitemap 提供的是候選清單,内鏈提供的是路径。蜘蛛顺着首頁進入栏目,再顺着栏目列表進入詳情頁,這條鏈路是它最熟悉、也最愿意反复走的。分頁連結是這條鏈路的延長线:第一頁之後的内容,往往只能通過它繼續被發現。

所以判断一個站点的抓取是否健康,可以先看两件事:列表頁上的詳情連結是不是纯 HTML 可讀;分頁連結能不能在不做任何交互的情况下被讀到。

分頁寫法的几種常见問题

只在点击後才出現的分頁

移動端常见的「加载更多」或無限滚動,初始 HTML 里往往没有任何下一頁連結。蜘蛛不會去点按钮,也就走不到第二頁往後。可行做法是保留一個静態的分頁連結,或者至少给出進入更深层列表的入口,让不执行 JS 的抓取也能繼續往下走。

分頁被 robots.txt 或频控挡住

有些站点為了避免重复内容,直接在 robots.txt 里屏蔽带 page 參數的地址。结果是詳情頁本身還能從別處被發現,但沿着分頁往下走的路径被切断了。屏蔽前最好先確認一件事:這條 Disallow 挡掉的只是分頁頁,還是连带挡掉了篩選頁、标簽頁里的詳情連結。

分頁頁被 noindex 或 canonical 指回第一頁

分頁頁不參與索引通常没問题,它本来就不是用来排名的。但要注意区分「不索引」和「不抓取」:noindex 的頁面蜘蛛仍會来抓,分頁連結依然可以通行。真正有影响的是把分頁做成需要交互才能進入,或者让翻頁地址根本不出現在任何 HTML 里。canonical 指回第一頁时,重点看它是否同时把連結也一起改掉了。

分頁本身也會消耗抓取资源

如果一個列表頁動辄列出上百條,每頁還要加载大量图片和脚本,蜘蛛單位時間能走完的分頁數就會下降,深层的存量内容自然排到後面。列表頁保持轻一点,把详细信息留给詳情頁,對抓取效率更友好。翻頁數量也不要人為收得太紧,「一共两百頁却只放出十頁」會让後面的内容彻底失去入口。

一份可以照着做的自查清單

  • 禁用 JS 後打開列表頁,確認分頁連結仍然存在且可点击。
  • 用抓取日誌核對:第二頁之後的 URL 是否還有蜘蛛訪問记錄。
  • 检查 robots.txt,確認没有把翻頁參數整体屏蔽。
  • 確認分頁連結带的是可讀 URL,而不是 onclick 事件或空 href。
  • 控制列表頁首屏 HTML 体积,减少不必要的内联脚本。
  • 老内容如果只剩 Sitemap 一個入口,考虑在相關推荐、标簽頁里补上内鏈。
分頁不是给人看的装饰,它是蜘蛛進入存量内容的楼梯。楼梯断在哪里,抓取就停在哪里。

分頁鏈路的問题通常不會立刻顯現,它更像慢性失血:首頁和最新文章一切正常,只有翻日誌才會發現老 URL 的抓取越来越少。定期检查一遍從列表頁到深层頁的路径,比事後追着抓取異常找原因要省力得多。