網站收錄

分頁列表與篩選參數頁被收錄:列表類 URL 的取舍顺序

分類頁、列表頁带上分頁和篩選參數後,一個栏目可能在索引里裂成几十個地址。本文按導航型分頁、參數组合頁、站内搜尋结果頁三類分別判断,给出從索引形態核對、canonical 指向、robots 與 noindex 選擇到 sitemap 提交的收口顺序,並列出排序參數、分頁 noindex 後條目發現等常见坑。

網站收錄

分頁列表與篩選參數頁被收錄:列表類 URL 的取舍顺序

分類頁、列表頁带上分頁和篩選參數之後,一個栏目在索引里可能裂成几十上百個地址。處理這類 URL,核心不是“全收”或“全砍”,而是分清哪些形態對用戶有獨立價值。

先分清三類列表 URL

1. 導航型分頁

?page=2、/page/2 這類是列表的自然延續。用戶會從第一頁翻到後面,内容位置明确、形態稳定,通常有明确的翻頁入口。

2. 參數组合頁

?color=red&size=l&sort=price 這類由篩選、排序、视图叠加出来的地址。组合數量随维度增長,很容易超出網站實际的内容体量。

3. 站内搜尋结果頁

?q=xxx 這類由用戶輸入驱動的頁面,内容随查询變化,一般没有稳定入口,也很难判断其獨立價值。

判断是否值得收錄的三個問题

  • 有没有人會搜這個地址:有稳定搜尋需求的分頁或篩選组合,可以保留。
  • 内容是否與主列表大量重复:如果第 2 頁只是同一批條目的重新排列,獨立價值有限。
  • 能不能被稳定抓取:數量無上限的 URL 會持續占用抓取资源,挤压真正需要更新的頁面。

核對與收口的顺序

  1. 先看索引里實际存在什么形態。確認被抓的是 /page/2 還是 ?page=2,不同形態的處理办法並不一样。
  2. 確認入口與内鏈。分頁連結如果只靠 JS 動態生成,或者干脆没有連結,蜘蛛的發現路径就會很不稳定。
  3. 决定 canonical 指向。想让分頁自己收錄,就自指;只想保留第一頁,就指向第一頁。注意不要把不同篩選结果的 canonical 全部指向首頁,那等于主動放弃差异化内容。
  4. 參數组合頁優先用 robots.txt 挡抓取,而不是 noindex。noindex 生效的前提是頁面能被抓取;如果數量大到抓不完,用 robots 屏蔽更直接,但要接受它無法传递 noindex 信号這一点。
  5. sitemap 只放你希望收錄的形態。把带參數的變体一並提交,等于主動扩大抓取面。
  6. 观察一到两個抓取周期再調整。一次改太多條件,後續無法判断是哪一步起了作用。

几個容易踩的坑

  • 排序參數(?sort=)通常没有獨立搜尋需求,是重复内容的高發区。
  • 分頁被 noindex 後,後面几頁的條目可能更难被發現,要確認這些條目還有其他入口。
  • 移動端與桌面端若使用不同參數,注意同一列表是否被拆成两套地址。
列表類 URL 的處理目标不是让索引數量變少,而是让索引里的地址都能對應到有人需要的頁面。

調整後的观察指标

重点看三個方向:被抓取的 URL 總量是否向内容頁倾斜;列表頁的抓取频率是否稳定;重要條目的發現時間有没有被拉長。如果收錄數量下降,但條目的發現速度没受影响,說明收口方向基本是對的。