網站收錄

列表頁翻頁與加载更多:分頁 URL 的收錄取舍與核對顺序

列表頁翻頁、加载更多和無限滚動對收錄的影响並不一样。這篇文章给出一個核對顺序:先分清分頁形態,再检查 URL 是否唯一、翻頁連結是否真的寫在 HTML 里、抓取與索引结果是否吻合,最後按頁面實际價值决定保留、归並還是挡掉。

網站收錄

列表頁翻頁與加载更多:分頁 URL 的收錄取舍與核對顺序

列表頁、商品列表、文章归档頁往往带翻頁。分頁内容既不是完全没價值,也不值得全部進索引,處理方式取决于它承担的作用:是让用戶和蜘蛛顺着連結一直往下走,還是僅僅作為浏览入口的补充。先把頁面價值和 URL 形態分清楚,再决定哪些留、哪些挡。

先分清分頁的三種形態

  • 静態翻頁連結:第二頁、第三頁各有獨立 URL,連結寫在 HTML 里能被直接抓到。
  • 加载更多 / AJAX 翻頁:点击按钮後由 JS 追加内容,地址栏可能不變,也可能用 history API 改成新地址。
  • 無限滚動:滚動到底自動加载,頁面地址始终不變,後續内容對蜘蛛預設不可见。

形態不同,核對重点也不同:前两種主要看 URL 是否唯一、連結是否可抓;第三種先要解决後續内容能不能被拿到的問题,再谈收錄。

按顺序核對這几件事

1. 確認哪些列表頁真的需要被發現

不是所有列表頁都需要進索引。判断标准可以简單一点:如果一個列表頁没有獨特的内容概览價值,比如只是按時間倒序堆着全部舊文章,它的作用更多是路径。這類頁面保留可抓取、可点击即可,不必强求收錄。

2. 检查分頁 URL 是否唯一且稳定

常见的情况是同一個第二頁存在多種寫法:带 page 參數、带 p 參數、路径式翻頁、再加排序參數後翻頁。多種寫法指向同一批内容,就會出現重复地址。核對时按出現频率排一遍,保留一種主寫法,其余用 canonical 或直接在内鏈里统一,而不是全部指望搜尋引擎自己归並。

3. 看翻頁連結是否真的在 HTML 里

用查看源代碼而不是開發者工具確認:翻頁按钮如果是 button 加 JS 事件,蜘蛛在初始 HTML 里可能拿不到下一頁地址。可行的做法是保留一组真實的 a 标簽連結,即使视觉上被样式替換成了按钮。

4. 看抓取與收錄结果是否吻合

如果服務器日誌里翻頁地址被抓取频繁,但索引里几乎没有,通常說明頁面被認為價值不高,属于正常現象,不必强行提交。反過来,如果日誌里根本看不到翻頁地址被抓,先回到第 2、3 步检查連結通路。

5. 定取舍:保留、归並還是挡掉

取舍可以按三点决定:内容概览是否高度重复、用戶是否需要單獨訪問這一頁、這一頁是否有獨立流量價值。三者都不满足时,保留抓取路径、不追求收錄,往往是更省事的選擇。

常见處理方式與各自代價

  • 统一 URL 寫法加内鏈指向主版本:成本低,适合大多數站点,需要持續检查新模板是否又引入了舊寫法。
  • canonical 指向第一頁:翻頁内容與第一頁高度重复时可用,但第二頁以上的獨特内容會一並被让出去,要確認没有獨立價值。
  • noindex 翻頁頁:能减少低價值頁面進索引,但蜘蛛仍會抓取;注意不要和 canonical 混用出矛盾信号。
  • robots.txt 屏蔽翻頁參數:见效直接,但被屏蔽的地址如果已经在索引里,通常不會因此被移除,需要配合其他手段。

容易被忽略的几個点

  • 排序、篩選參數和翻頁叠加,會产生大量组合地址,這類地址更适合整体挡掉,而不是逐個處理。
  • 翻頁頁面上的文章摘要有时比正文頁更早被收錄,這是正常的抓取顺序,不代表内容重复一定有問题。
  • 移動端和桌面端的分頁地址如果不一致,容易各自形成一套索引,核對时要分開看。
  • 列表頁數量随内容增長,上线新栏目後要重新检查一遍内鏈和 URL 規則,而不是一次設定完就放着。
分頁的取舍不是能收錄就都收,而是先明确這一頁承担的是路径還是内容,再决定它的收錄目标。目标定清楚了,URL 規范、canonical 和 noindex 的選擇才有依據。