網站收錄

分頁 URL 要不要收錄:第 2 頁之後的取舍

分頁地址要不要進索引,没有统一答案。文章從分頁 URL 的三種形態出發,說明哪些情况下分頁值得保留在索引里、哪些應当排除,並對比 noindex、canonical 與 robots.txt 三種處理方式的适用场景和容易踩的坑,最後给出一份可直接對照的自检清單。

網站收錄

分頁 URL 要不要收錄:第 2 頁之後的取舍

列表頁翻頁几乎每個站都有:文章列表、商品列表、搜尋结果都會产生第 2 頁、第 3 頁。這些地址要不要让搜尋引擎收錄,没有统一答案,關键看它們對用戶和搜尋引擎各自意味着什么。

先看分頁地址是怎么生成的

常见的分頁 URL 有三種形態,處理方式並不一样。

  • 路径式:形如 /list/page/2/,层級清晰,蜘蛛容易识別。
  • 參數式:形如 /list?page=2,容易和其他參數混在一起,也更容易出現重复入口。
  • 点击追加:頁面不換 URL,靠脚本往下加载内容,這種情况下並不存在真正的第 2 頁地址。

分頁有没有獨立價值,先問一個問题

可以用一句话做判断:這個分頁地址上,有没有用戶會主動搜尋的獨立内容?

  • 商品、文章的深分頁,條目本身在詳情頁各有地址,分頁只承担導航作用,通常没有獨立搜尋需求。
  • 分類下只有两三頁,且第 2 頁包含明顯的品類组合,内容也确實不同,保留在索引里一般没有坏處。
  • 篩選、排序、站内搜尋产生的分頁,參數组合多到無法收敛,通常不建议收錄。

让分頁進索引时要注意什么

保留分頁收錄,前提是它真的能被抓、能被正常渲染。翻頁連結要是普通的可点击連結,而不是依赖点击事件才生成;頁面上的條目要能通過連結到達各自的詳情頁,這样蜘蛛顺着分頁往下走,才有机會發現更靠後的内容。同时確認分頁之間没有互相指向第一頁的 canonical,否則收錄的意义會被自己消掉。

不让分頁進索引时的几個坑

  • 用 robots.txt 屏蔽:蜘蛛抓不到分頁,也就無法顺着它發現後面的詳情頁,深頁面的發現速度可能變慢。
  • 用 noindex:蜘蛛仍需抓取才能看到指令,抓取開销照付,但能避免頁面進入索引。
  • 把分頁 canonical 指向第一頁:如果分頁确實没有獨立價值,這是可以接受的做法;如果它本身有内容價值,這么做等于主動放弃收錄。
canonical 和 noindex 同时出現在分頁上时,信号容易互相打架。選定一種主要手段,其它設定尽量保持简單。

可以观察的几個信号

分頁處理完不必立刻下结论。可以在搜尋表現里看分頁地址有没有带来過点击;在抓取记錄里看蜘蛛訪問分頁的频率,以及它是停在分頁還是繼續走到詳情頁;做收錄對帳时,看索引中的分頁數量和线上實际分頁數量差多少。這些資料比“應该收還是不收”的直觉更可靠。

一份简短的自检清單

  1. 分頁地址是否稳定、可预测,翻頁連結是否能被直接抓取。
  2. 分頁上的條目是否都有獨立詳情頁地址,連結是否可達。
  3. 分頁與第一頁之間是否出現了互相矛盾的規范與索引指令。
  4. 如果不让收錄,選擇的手段會不會连累詳情頁的發現。
  5. 處理之後留出時間观察抓取和索引记錄的變化,再决定是否調整。

分頁本身不是問题,問题往往是分頁上的指令前後不一致,或者用屏蔽的方式挡住了自己需要的發現路径。先把這两点理顺,收不收錄通常會變得容易判断。