搜尋抓取

列表頁的分頁與归档:蜘蛛能翻到多深,取决于連結怎么寫

列表頁是蜘蛛除首頁之外最常走的路径,翻頁連結寫得對不對,直接决定靠後的 URL 能不能被發現。本文從三種常见翻頁寫法的差异、分頁地址的處理規范、归档頁對老内容的暴露作用,以及篩選排序參數带来的抓取浪費几個角度,讲清楚怎么让分頁真正成為一條可用的抓取通道。

搜尋抓取

列表頁的分頁與归档:蜘蛛能翻到多深,取决于連結怎么寫

列表頁是蜘蛛的第二入口

除了首頁和栏目頁,蜘蛛最常走的路径之一就是列表頁。它把一批 URL 集中暴露出来,翻頁連結决定這些 URL 能被翻到第几屏。如果翻頁只能靠点击触發、地址栏不變,靠後的内容在抓取路径上就會断掉。

三種常见的翻頁寫法

  • 獨立地址的分頁連結:形如 /list/?page=2、/list/page/2/,每頁都是普通連結,蜘蛛可以一頁頁跟下去。
  • 点击加载更多:按钮绑定脚本事件,地址栏不動。蜘蛛执行脚本时可能拿到新 URL,不执行就停在第一頁。
  • 滚動加载:没有可点击的連結,翻頁由滚動触發,抓取路径基本無法延續。

如果站点用的是後两種,建议保留一個传统分頁入口,比如「下一頁」的連結或按頁碼拆分的静態路径。不必每頁都做成獨立頁面,但至少要留一條能被跟下去的线。

分頁 URL 要能直接打開

  • 分頁參數變化时,頁面主体内容應随之變化,而不是始终返回第一頁的内容。
  • 第二頁及之後的頁面不要指向首頁或第一頁的 canonical,否則蜘蛛容易把两者当成同一份内容。
  • 分頁頁面的标题與列表項要能正常輸出,不要依赖登入或表單提交才看得到。
  • 如果产品有「查看全部」视图,注意它和分頁视图的地址關系,避免两套地址互相争夺同一個位置。

归档頁和時間轴:让老内容再被翻到

新内容靠在首頁和栏目首頁,老内容的入口會越来越浅。按月份、标簽、分類做的归档頁,是把老 URL 重新拉回抓取路径的方式之一。做法上注意两点:归档頁本身要能翻頁,否則翻到第一屏就結束;归档頁要真的有内容,空标簽頁、只有一两條记錄的归档頁價值不大,數量和层級都要克制。

別让分頁掉進參數泥潭

排序、篩選、视图切換如果都寫成 URL 參數,很容易组合出成千上萬個地址。這些地址大多内容相近,蜘蛛跟進去只會消耗抓取资源,對 URL 發現帮助有限。常见處理是:保留少量有價值的篩選组合,其余用 robots 規則屏蔽,或者让連結不被繼續跟。

判断标准很简單:這個地址是否有獨立的内容價值。有,就让它進抓取路径;没有,就別让蜘蛛把時間花在上面。

怎么检查分頁是不是真的通

  1. 在日誌里看列表頁的分頁地址有没有被訪問,訪問到第几頁。
  2. 用抓取工具模拟一次,確認翻頁連結是普通連結,且能一路点到最後一頁。
  3. 检查分頁頁面的标题、canonical 和列表内容是否正常變化。
  4. 對重要的归档頁,可以在站点地图中單獨列出,但不必把所有分頁地址都塞進去。

分頁不是新鲜话题,但它决定了蜘蛛能不能沿着你设計的路线,把站点里的老内容一頁頁翻出来。把連結寫清楚、把參數收干净,比事後补 Sitemap 更省事。