網站收錄

分頁與列表頁的收錄取舍:第二頁之後還值不值得被索引

列表頁和分頁往往只有排序差异,却常常要么整站被抓一遍,要么第二頁之後再無踪影。這篇文章從地址形態、内容差异和抓取成本出發,讨论哪些分頁值得保留收錄、哪些适合用 canonical 或 noindex 收敛,並给出一份可以直接照着做的自查清單。

網站收錄

分頁與列表頁的收錄取舍:第二頁之後還值不值得被索引

列表頁和分頁几乎是每個内容站、电商站都會有的頁面形態,但它們在收錄問题里常常被当成附属品——要么整站都被抓了一遍,要么第二頁之後永遠進不了索引。這两種结果其實都不算理想,關键是想清楚一件事:這一頁對搜尋者有没有獨立價值。

分頁為什么會變成一堆近似頁面

分頁往往只有排序位置不同,标题、描述、摘要模板高度一致。蜘蛛顺着連結逐條抓下来,很容易把整串地址判定為高度重复的序列,于是從中挑一两個作為代表,其余的不索引,或者索引了也很少获得流量。

更麻烦的是抓取成本。一個几百頁的列表,如果每頁都完整展開,就會占掉相当一部分抓取次數,而這些次數本可以留给真正的内容頁。

先看分頁的地址長什么样

  • 路径式:形如 /list/page/2/ 的静態路径,對蜘蛛最友好,也最容易單獨控制。
  • 參數式:?page=2 這類寫法本身没問题,但參數一多,同一頁容易衍生出多種地址,需要先统一。
  • 無限滚動:地址栏不變,内容靠脚本追加,蜘蛛通常只能看到第一屏,後面的内容等于不存在。

如果确實希望滚動列表被收錄,常见做法是同时保留一套可訪問的分頁地址,让滚動只作為浏览体驗层。

哪些分頁值得保留

判断标准可以简化成一句:這一頁上有没有別處没有的東西。

  • 商品列表、文章归档:第二頁之後往往仍包含獨占的條目,用戶也确實會往後翻,保留收錄通常有意义。
  • 带篩選维度的列表:只有当這個组合本身存在搜尋需求时才考虑放開,否則容易批量生成低價值组合頁。
  • 纯導航型分頁:每頁只有几條摘要,点進去還是同一批内容,索引價值很低。

几種常见的收敛手段

canonical 與 noindex 的分工

如果分頁内容與主列表高度重叠,可以把第二頁之後 canonical 指向第一頁;如果希望頁面仍能正常訪問但不進入索引,用 noindex 更直接。两者不要在同一组頁面上互相矛盾地叠加,否則蜘蛛只能自行猜测。

rel=next 與 rel=prev 已不再是收錄信号

這套标簽如今更多只是提示,不要指望靠它解决重复問题,真正起作用的仍然是内容差异和 canonical 的一致性。

參數規范化

排序參數、来源追踪參數、會话參數混進分頁地址,會让蜘蛛把同一頁当成几十個不同地址。先固定一套书寫方式,再来谈收錄處理。

一份可执行的自查清單

  1. 手動打開第二頁、第三頁,看标题和摘要是不是几乎相同。
  2. 在服務器日誌里數一下,分頁地址占了多少抓取次數。
  3. 確認分頁地址没有混入排序、篩選、来源等無關參數。
  4. 检查無限滚動是否配有可抓取的分頁地址。
  5. 明确哪些分頁放開、哪些收敛,寫成規則,而不是逐頁临时决定。
分頁處理的目标不是让每一頁都進索引,而是让索引里的頁面各有各的用途。收錄數量本身不是成绩。

最後提醒一点:分頁策略調整之後,索引层面的變化通常滞後數周。观察效果时最好把日誌里的抓取频次和索引报告放在一起看,避免因為短期波動就反复改動規則。