站点运营

站点运营:分頁與翻頁自查,別让蜘蛛把列表頁一路翻到底

分頁是列表型站点最容易被忽略的抓取入口。翻頁參數混乱、列表标题互相重复、無限滚動不落連結,都會让蜘蛛在同一個栏目里兜圈子。本文梳理分頁自查的几個要点,帮你把有限的抓取額度留给真正的正文頁面,而不是消耗在無尽翻頁上。

站点运营

站点运营:分頁與翻頁自查,別让蜘蛛把列表頁一路翻到底

栏目頁和列表頁是蜘蛛進入正文的主要通道,但通道本身也有成本。当一個分類下有几十上百頁翻頁,而每一頁的标题、描述、正文片段都差不多时,蜘蛛很容易把大量時間花在這條通道上,真正需要被發現的文章反而排在了後面。分頁不是不能有,而是要让它在结构上清楚、在數量上有邊界。

先看蜘蛛是怎么翻頁的

常见的翻頁實現大致有三種,它們對抓取的影响並不一样:

  • 静態路径分頁,例如 /list/2/、/list/3/,每一頁都有獨立可訪問的地址;
  • 參數分頁,例如 /list?page=2,地址可變但容易叠加其他參數;
  • 前端加载更多或無限滚動,只有在浏览器里滚動才會繼續取内容。

前两種更容易被稳定發現和跟踪,第三種如果没有可訪問的連結作為兜底,翻頁出来的内容往往只存在于訪客的浏览器里,蜘蛛翻到第一屏就結束了。

分頁自查清單

  1. 翻頁連結是否真的可点击。打開列表頁,查看源代碼,確認“下一頁”是一個真實的 a 标簽連結,而不是纯 JS 事件。可点击的連結才是蜘蛛繼續往下走的台阶。
  2. 列表頁标题是否互相重复。第 1 頁到第 20 頁全都叫同一個标题,會让蜘蛛难以判断哪一頁更值得保留。至少在标题里体現出頁碼或栏目分段。
  3. 深分頁有没有邊界。一直翻到第 300 頁、内容却是三年前的舊闻,這類頁面基本没有訪客價值,還會分走抓取額度。可以考虑設定翻頁上限,或者把舊内容收進归档入口。
  4. 翻頁參數是否收敛。page=2 後面再挂排序、篩選、跟踪碼,會衍生出大量地址相似、内容相同的頁面。让分頁參數保持單一、干净。
  5. 列表頁是否被当成正文頁来優化。列表頁的职责是分發連結,不是承载長文。堆大量關鍵詞反而模糊了頁面定位。
  6. 有没有归档或時間维度的第二入口。当翻頁被截断时,归档頁能让蜘蛛從另一個方向找到舊内容。

几種常见的坑

無限滚動只加载、不落連結

视觉上很流畅,但對抓取並不友好。比較稳妥的做法是保留一個可訪問的分頁地址作為兜底,或者為加载出来的内容生成對應的獨立連結。

翻頁參數被跟踪碼污染

從推廣渠道進来的翻頁地址带上了来源參數,如果這些地址被外部引用,就會形成同一頁面的多個版本。检查一下列表頁是否存在這類入口。

把成千上萬個列表頁塞進站点地图

站点地图是给蜘蛛指路的,不是把所有地址都倒出来。只保留主要栏目和必要的分頁入口,比一股脑提交更有效。

修复的優先顺序

如果一时改不完,可以按這個顺序處理:先保證翻頁連結可被直接訪問,再解决标题重复和參數收敛,最後處理深分頁和归档入口。同时對照訪問日誌,看看蜘蛛實际翻到了第几頁、哪些翻頁被反复抓取却没有新增内容,這些資料比猜测更可靠。

分頁的目标不是让蜘蛛翻完所有頁面,而是让它在有限的行程里先找到值得收錄的正文。列表可以深,但入口要清晰,邊界要明确。

分頁看起来只是几個按钮的事,實际影响着整個站点的抓取效率。定期打開栏目頁翻到最後几頁,用訪客的视角走一遍,往往就能發現那些被忽略的問题。