分類頁、列表頁带上分頁和篩選參數之後,一個栏目在索引里可能裂成几十上百個地址。處理這類 URL,核心不是“全收”或“全砍”,而是分清哪些形態對用戶有獨立價值。
先分清三類列表 URL
1. 導航型分頁
?page=2、/page/2 這類是列表的自然延續。用戶會從第一頁翻到後面,内容位置明确、形態稳定,通常有明确的翻頁入口。
2. 參數组合頁
?color=red&size=l&sort=price 這類由篩選、排序、视图叠加出来的地址。组合數量随维度增長,很容易超出網站實际的内容体量。
3. 站内搜尋结果頁
?q=xxx 這類由用戶輸入驱動的頁面,内容随查询變化,一般没有稳定入口,也很难判断其獨立價值。
判断是否值得收錄的三個問题
- 有没有人會搜這個地址:有稳定搜尋需求的分頁或篩選组合,可以保留。
- 内容是否與主列表大量重复:如果第 2 頁只是同一批條目的重新排列,獨立價值有限。
- 能不能被稳定抓取:數量無上限的 URL 會持續占用抓取资源,挤压真正需要更新的頁面。
核對與收口的顺序
- 先看索引里實际存在什么形態。確認被抓的是 /page/2 還是 ?page=2,不同形態的處理办法並不一样。
- 確認入口與内鏈。分頁連結如果只靠 JS 動態生成,或者干脆没有連結,蜘蛛的發現路径就會很不稳定。
- 决定 canonical 指向。想让分頁自己收錄,就自指;只想保留第一頁,就指向第一頁。注意不要把不同篩選结果的 canonical 全部指向首頁,那等于主動放弃差异化内容。
- 參數组合頁優先用 robots.txt 挡抓取,而不是 noindex。noindex 生效的前提是頁面能被抓取;如果數量大到抓不完,用 robots 屏蔽更直接,但要接受它無法传递 noindex 信号這一点。
- sitemap 只放你希望收錄的形態。把带參數的變体一並提交,等于主動扩大抓取面。
- 观察一到两個抓取周期再調整。一次改太多條件,後續無法判断是哪一步起了作用。
几個容易踩的坑
- 排序參數(?sort=)通常没有獨立搜尋需求,是重复内容的高發区。
- 分頁被 noindex 後,後面几頁的條目可能更难被發現,要確認這些條目還有其他入口。
- 移動端與桌面端若使用不同參數,注意同一列表是否被拆成两套地址。
列表類 URL 的處理目标不是让索引數量變少,而是让索引里的地址都能對應到有人需要的頁面。
調整後的观察指标
重点看三個方向:被抓取的 URL 總量是否向内容頁倾斜;列表頁的抓取频率是否稳定;重要條目的發現時間有没有被拉長。如果收錄數量下降,但條目的發現速度没受影响,說明收口方向基本是對的。