站点运营

站点运营:分頁與列表頁自查,別让蜘蛛在翻頁里空轉

列表頁和分頁是站内連結的主要来源,也是最容易被忽略的抓取入口。本文按連結形式、地址统一、canonical 與 noindex 取舍、翻頁邊界、列表頁内容质量、日誌复核六個方面,给出一份可执行的分頁自查清單,帮你把抓取額度留给真正的内容頁。

站点运营

站点运营:分頁與列表頁自查,別让蜘蛛在翻頁里空轉

列表頁和分頁是站内連結最密集的地方,也是蜘蛛最容易陷進去的地方。一個栏目如果翻到第 200 頁還有内容,蜘蛛可能先把這两百頁走完,才回头去看你真正想被看到的那几篇文章。分頁本身不是問题,問题在于分頁没有邊界、没有規則,也没有人管。下面這份清單可以按顺序過一遍。

一、分頁連結是不是真實連結

  • 打開頁面源碼,確認“下一頁”用的是 a 标簽带 href,而不是绑定 click 事件的按钮。纯 JS 翻頁在未渲染的 HTML 里往往什么都没有。
  • 检查分頁連結有没有被顺手加上 rel="nofollow"。列表頁的主要價值就是给内容頁提供入口,屏蔽掉等于自断路径。
  • 如果站点依赖前端渲染列表,確認渲染後的連結能被正常解析,或者干脆在 HTML 里輸出一份分頁導航。

二、分頁地址的形式要统一

同一個列表同时存在 ?page=2 和 /page/2/ 两套地址,是常见的重复来源。做法是确定一種為主,另一種用 301 指過去,或者干脆不生成。

  • 第一頁尤其容易出問题:列表首頁和 ?page=1 往往是同一批内容,選一個作為規范地址即可。
  • 警惕參數叠加。排序、篩選、分頁三個參數组合起来會产生大量近似地址,蜘蛛走進去很难自己绕出来。
  • 篩選類參數如果對内容没有實质区分,建议不生成可抓取連結,或直接屏蔽抓取。

三、canonical 與 noindex 怎么取舍

一個常见的誤操作是把所有分頁頁的 canonical 都指向列表第一頁。這样做的结果是,後面的分頁不再被当作獨立入口,列表頁作為抓取通道的作用被削弱。

  • 分頁頁通常指向自身更稳妥;如果内容确實高度重复且無獨立價值,再考虑其他處理。
  • rel="next" / rel="prev" 現在不再被主流搜尋引擎用作索引信号,可以保留作為爬取线索,但不要把它当成一條規則来依赖。
  • 如果某類列表頁只是聚合、没有獨立價值,可以考虑 noindex, follow,既不让它占索引,又保留連結和抓取路径。

四、翻頁的邊界要明确

  • 超出范围的頁碼,例如只有 10 頁却請求第 11 頁,應返回 404 或合适的错誤狀態,而不是统统返回 200 加一個空列表,否則會引出無穷無尽的空頁。
  • 無限滚動(瀑布流)要額外提供可点击、可被抓取的分頁連結,否則内容只能靠接口地址被發現。
  • 移動端和 PC 端分頁行為應保持一致,不要一邊能翻、另一邊只能看第一頁。

五、列表頁自身的内容质量

  • 分頁頁的标题不要整站或整栏目一個样,至少能体現出层級或頁碼差异。
  • 列表項尽量带摘要或缩略图,避免整頁只有密密麻麻的纯連結,這類頁面通常很难有獨立價值。
  • 長期没有内容的空栏目、空标簽頁,该合並就合並,该下线就下线,不要留着让蜘蛛反复訪問。

六、用日誌复核,而不是凭感觉

翻頁問题最後還是要回到日誌上驗證。統計一段時間内蜘蛛的請求分布,看看列表頁和分頁占了多少比例。如果發現某個栏目的分頁請求量遠高于内容頁,基本可以判断抓取被翻頁吃掉了。

分頁不是要一刀切删掉,而是让每一頁都有明确的作用:要么提供入口,要么承载内容,要么干脆不生成。

建议把這份检查做成固定動作:新增栏目时確認分頁規則,改版时確認地址形式没有分叉,每季度按日誌复核一次。分頁這種细节平时不顯眼,但一旦失控,代價就是蜘蛛的時間被大量消耗在翻頁上。