站点里數量最多的一類 URL,往往不是文章頁,而是翻頁、篩選、排序组合出来的頁面。它們對用戶有用,但是否值得進索引,是另一個問题。處理得好,能帮蜘蛛發現新内容;處理不好,會让索引里堆满内容高度相似的地址。
先把三類頁面分開看
虽然都带參數,但它們的性质不同,處理方式也不该一样。
- 翻頁:/list?page=2 這類,内容随頁碼變化,通常越往後價值越低。
- 篩選:按分類、品牌、價格区間過滤,部分篩選组合有真實搜尋需求。
- 排序:按時間、销量、價格排序,同一批内容換個顺序,几乎不产生新信息。
判断的核心:這個地址有没有獨立搜尋需求
可以拿一個简單的問题去問:用戶會不會在搜尋框里輸入對應的词?如果一個頁面的意图完全能被上一級頁面覆盖,它進索引後大概率只是與主頁面竞争,而不是带来額外流量。
篩選頁要特別小心。某些篩選组合确實對應清晰的查询意图,比如「城市 + 戶型」,這類頁面可以考虑保留;而三四個條件叠加出来的長尾组合,往往是數量爆炸的来源。
让它們進索引,代價是什么
主要代價不在服務器,而在抓取预算和索引质量。
- 蜘蛛在翻頁和篩選组合上花費的抓取次數,本可以用在真正需要更新的内容頁上。
- 索引里混入大量近似頁面後,去重和選主版本的過程會更频繁,容易出現「收錄的是哪一版」這種难以预测的情况。
- 站内連結權重被稀释,重要頁面的入口可能被埋在几十個组合地址之後。
几種常见做法和适用场景
- 翻頁保留、但控制深度:前几頁可抓可取,靠後的頁碼通過分頁連結层級自然收敛。
- 排序參數统一處理:排序只改變展示顺序,不适合作為獨立頁面,通常可以用參數規范或 robots 規則统一归拢到一個地址。
- 篩選按需求分級:有搜尋需求的组合保留並加自指 canonical,無需求的组合用 noindex 或屏蔽抓取。
- 列表頁本身做好入口:列表頁的價值更多在于把内容頁暴露给蜘蛛,而不是自己被收錄。
判断标准可以简化成一句话:這個地址如果被收錄,會不會给用戶带来上一級頁面给不了的東西。答案是否定的时候,留着它做連結通道就够了。
動手之前,先看两组資料
第一组是抓取日誌里這類 URL 占的比例,第二组是它們在索引里的數量和带来的点击。如果抓取占比很高、点击接近零,就值得重新分配抓取预算;反過来,如果某個篩選頁确實稳定带来流量,就不该一刀切地屏蔽。
處理完记得观察後續變化。規則改完之後,索引里的舊地址不會立刻消失,通常會经歷一段逐步替換的過程,短期内數量上下浮動属于正常現象,重点是看趋势而不是看某一天的數字。