網站收錄

翻頁和列表頁的收錄處理:第 2 頁之後要不要進索引

列表頁和翻頁是蜘蛛發現内容的主要入口,但頁數一多就容易产出大量近似、低價值的 URL。本文拆解传统翻頁、無限滚動、view-all 等常见形態的收錄取舍,並给出先看資料還是先改連結的判断顺序。

網站收錄

翻頁和列表頁的收錄處理:第 2 頁之後要不要進索引

站内的列表頁、分類頁和翻頁,是蜘蛛發現新内容最主要的通道之一。一個栏目往下翻二十頁,就多出二十個 URL;资讯、电商、论坛類站点很容易在不知不觉中把索引撑大。問题不在于要不要有列表頁,而在于哪些翻頁 URL 值得留在索引里。

列表頁和翻頁各自承担什么角色

列表第一頁通常同时是導航入口和内容摘要,有獨立标题、相對稳定的内容,多數情况下值得收錄。第 2 頁及以後,内容主体往往是同一批條目的重新排序,頁面價值明顯下降,但它仍然是蜘蛛往深處爬的路径。所以抓取和收錄要分開看:可以让蜘蛛爬,不代表一定要让它進索引。

值得留在索引里的翻頁

  • 頁面本身有可讀内容,例如带摘要、带篩選說明,而不是只有标题列表;
  • 该頁是站内少數几條通向深层内容的路径,去掉之後部分頁面會變成孤岛;
  • URL 稳定、參數简洁,内容不随訪問者身份變化。

不值得留在索引里的翻頁

  • 由排序、篩選參數组合出来的近似頁,同一批商品換一種顺序就是一個新 URL;
  • 内容基本是标题堆叠,用戶落地後還得再点一次才能看到正文;
  • 由加载更多動態拼接出来、本身没有獨立入口的頁面。

常见分頁形態怎么處理

传统 ?page=2 式翻頁

保持可抓取,让蜘蛛能顺着連結繼續往下走。同时判断這批 URL 是否值得單獨收錄:如果頁面内容高度重复,可以用 canonical 指向序列中的規范形態,或對靠後的頁碼使用 noindex,把抓取和索引的意图分開表達。

無限滚動和加载更多

滚動加载的内容在初始 HTML 里往往没有對應連結,不执行脚本的抓取就到此為止。建议保留一份可点击的分頁連結作為兜底,让抓取能沿着真實連結往下走,而不是依赖脚本触發。

view-all 合並頁

把多頁内容合並成一頁,理论上能减少重复 URL,但内容量一大,頁面會變得很長、加载變慢,用戶和抓取都未必受益。條目數量可控时可以用,量大时更适合保留分頁结构。

先用資料自查,再决定改什么

  1. 看日誌或後台資料里蜘蛛的抓取分布,估算翻頁占用了多少抓取量;
  2. 抽查若干翻頁 URL 的收錄情况和落地内容,判断是重复還是各有用途;
  3. 区分是抓取浪費還是索引膨胀,两者處理方式不同,不要一起動手;
  4. 改動後观察一到两個抓取周期,再决定是否加第二步調整。
翻頁是否被收錄,最终是搜尋引擎自己做的取舍。你能做的是把信号说清楚:哪些頁是内容頁,哪些只是通往内容頁的路径。

分頁没有统一答案。同一站点里,栏目翻頁和篩選翻頁的處理方式也可以不同。關键是別让近似頁面互相竞争,也別為了省索引而把蜘蛛挡在通往深层内容的路上。