搜尋抓取

列表頁翻到第几頁就停了:分頁抓取深度與深层内容的补位

分頁列表是蜘蛛發現内容頁的主要通道,但越往後的分頁越少被抓。本文讲清這背後的取舍逻辑,並给出让分頁保持可抓、為深层内容补第二條通道的具体做法,以及調整之後该看哪些日誌指标来驗證。

搜尋抓取

列表頁翻到第几頁就停了:分頁抓取深度與深层内容的补位

蜘蛛翻頁,翻到一定程度就停了

做站点运营的人常會遇到一個現象:列表頁第一頁抓得勤,第二頁、第三頁偶尔来一次,再往後基本没動静。這不是蜘蛛偷懒,而是它在有限的時間和带宽里做取舍。理解這個取舍,比反复提交 Sitemap 更有用。

為什么越往後的分頁越少被抓

  • 抓取预算有限:一個站点每天能分到的抓取次數大体稳定,蜘蛛會把次數優先给更新频繁、结构清晰的頁面。
  • 連結權重随层級衰减:第 20 頁的連結要经過十几次跳轉才被看到,它在站内的信号本就弱。
  • 頁面相似度高:分頁列表之間内容重叠大,蜘蛛判断邊际價值低,自然不會深挖。
  • 參數组合膨胀:排序、篩選、每頁數量這些參數一旦叠加,URL 數量成倍增長,蜘蛛更會提前收手。

先量,再改

抓取日誌里筛出含 page、p、start 之類參數的 URL,統計被訪問的頁數分布和返回狀態碼。很多站点會發現第 5 頁之後就几乎没有记錄。這個數字就是你目前的分頁深度上限,改版前後做對比才有意义,否則只是凭感觉調整。

让分頁可抓,但別指望它無限延伸

分頁連結寫成真實的 a 标簽

用按钮加事件加载下一頁,蜘蛛多半看不到後續連結;即便能执行 JS,成本也高、出错概率也大。把「下一頁」做成可点击的正常連結,是成本最低的做法。

控制可索引的分頁范围

並不是所有分頁都需要被抓。一個带三個篩選维度的列表,可能产生上萬條组合 URL。可以只保留一條主分頁路径,其余组合用參數收敛或阻止抓取,把预算留给真正承载内容的頁面。

给列表頁一個稳定的排序

預設按時間倒序,新内容能很快進入第一頁並顺着内鏈被爬。如果是随机排序,蜘蛛每次看到的内容都不一样,反而降低判断效率。

深层内容需要第二條通道

分頁翻不到底,不代表深层内容就没有被發現的机會。常见的补位方式有:

  • 在分類下再分子類,把内容层級压到三到四层;
  • 用标簽頁、专题頁、热门排行等聚合入口,把舊内容重新暴露在第一頁可達范围;
  • 把不指望靠分頁發現的 URL 寫進 Sitemap,作為獨立的發現通道;
  • 在正文里做相關阅讀、上一篇下一篇的内鏈,让老内容持續被引用。
分頁是發現通道,不是索引目标。它的作用是让蜘蛛顺着走到内容頁,所以判断标准只有一個:顺着它能走到的地方,是否覆盖了你真正在乎的頁面。

几種常见做法的副作用

  • 把深层分頁设成 noindex,follow:可以,但要確認連結仍被跟随,且不要誤伤内容頁。
  • 用無限滚動替代分頁:要保留一套可抓的分頁 URL 作為退路,否則蜘蛛只能看到首批内容。
  • 给分頁加 canonical 指向第一頁:需谨慎,這會削弱後續分頁上内容頁的發現信号。

改完之後看什么

調整後两到四周,回到日誌看三件事:分頁抓取的頁數分布有没有變化、深层内容頁的首次抓取時間是否缩短、内容頁整体被抓次數是否上升。如果深层頁面的抓取没有變化,問题往往不在分頁本身,而在内容更新频率或整站的抓取预算上,這时需要換個方向排查。