網站收錄

站内搜尋頁和篩選頁被大量收錄:先分類,再决定收還是放

站内搜尋頁和篩選頁常被大量抓取,處理时不宜一刀切。本文按 URL 特征把這類頁面分成搜尋词结果頁、單條件篩選、多條件组合、排序參數和會话參數几類,给出保留與收敛的判断标准,以及 canonical、noindex、robots 屏蔽和連結控制的搭配方式和處理顺序。

網站收錄

站内搜尋頁和篩選頁被大量收錄:先分類,再决定收還是放

很多站点在查收錄資料时,會突然發現一批意料之外的 URL:站内搜尋结果頁、带篩選條件的列表頁、各種排序组合。它們的共同点是能被生成、能被連結到、也能被蜘蛛顺着抓到,于是慢慢出現在索引里。處理這類頁面,最怕两種做法:一種是一刀切全部屏蔽,另一種是放着不管任其增長。更實际的思路是先把它們分類,再按類別决定留還是收。

為什么這類頁面容易被大量抓取

站内搜尋和篩選本来是為了帮用戶缩小范围,但技術上它們大多通過 URL 查询參數實現。用戶在頁面上点几下,就會产生一個新的 URL;如果這些連結以普通 a 标簽形式存在,蜘蛛同样可以点击、跟随、抓取。一個内容量中等的站点,篩選维度只要有三四個,组合出来的 URL 數量就可能遠超正文頁本身。

另一個原因是這些頁面往往並不孤立:它們和列表頁、詳情頁之間有正常的内鏈,蜘蛛在抓列表頁时顺手就把它們带走了。所以問题通常不是蜘蛛主動去找,而是站点自己把它們递了過去。

先分類,再判断

把這類 URL 按特征分成几组,處理起来會清晰很多:

  • 搜尋词结果頁:例如 ?q=關鍵詞,内容随用戶輸入變化,理论上接近無限。
  • 單條件篩選:例如 ?color=red,维度固定、取值有限。
  • 多條件组合:例如 ?color=red&size=m&sort=price,组合數量呈倍數增長。
  • 排序參數:例如 ?sort=new,内容與預設頁高度重合,只是顺序不同。
  • 會话與追踪參數:例如 ?sid=、?from=,同一個頁面被複製成多份。

分類之後,判断标准主要看三点:這個頁面有没有獨立的搜尋需求、内容是否足够獨特、數量是否可控。三点都满足的,可以考虑保留;只满足一部分的,适合做收敛;都不满足的,收掉更省事。

可以考虑保留的情况

某些篩選维度本身就是用戶會直接搜尋的词,例如品牌加型号、城市加服務類型。這類頁面如果能稳定提供该组合下的真實结果,並且有獨立的标题、描述和一定量的正文内容,它就有成為着陆頁的價值。但前提是數量有限、组合有意义,而不是让程序自動拼出成千上萬個。

建议收敛的情况

排序參數、會话參數、無意义的多條件组合,通常没有獨立價值。它們與主列表頁内容高度重复,只改變呈現顺序或来源标记,留在索引里只會增加重复内容的比例,影响對站点整体内容质量的判断。

處理方式的搭配

  • canonical 指向主列表頁:适合内容基本一致、只是參數不同的頁面,让索引归属集中到主頁面。
  • noindex:适合頁面本身有内容、但不希望出現在搜尋结果里的情况。需要注意頁面必须能被抓取,蜘蛛才能讀到這個标簽。
  • robots.txt 屏蔽:适合组合數量巨大、没有收錄價值、也不想消耗抓取资源的路径。屏蔽後蜘蛛讀不到 noindex,已收錄的舊 URL 可能長期留在索引里,需要配合其他處理。
  • 連結层面控制:篩選連結改為按钮或表單提交,或對連結加 nofollow,從源头减少被發現的机會。
處理這類頁面的目标是让抓取和索引集中在真正有内容的 URL 上,而不是把某個數字压下去。不同做法有各自的副作用,改之前先想清楚希望達到什么狀態。

一個可以參考的處理顺序

  1. 導出一段時間内的抓取與收錄資料,按 URL 特征归類。
  2. 統計每類的數量和内容重合度,区分值得留和應该收的。
  3. 對應该收的,先判断是否還在被大量抓取,再决定用連結控制、canonical 還是屏蔽。
  4. 調整後观察一段時間,看正文頁的抓取量是否因此變多。
  5. 复查索引中舊 URL 的變化,没處理的再补一轮。

改完之後看什么

這類調整的效果不會立刻顯現。比起盯着收錄總數,更值得關注的是正文頁的抓取频次、索引里有效 URL 的占比,以及新内容從發布到被處理的节奏是否變顺。如果調整後正文頁抓取没有明顯變化,說明瓶颈可能不在這些參數頁上,需要回到内鏈结构和内容本身去看。

最後提醒一点:站内搜尋頁和篩選頁並不是天然有害,它們只是容易被無限制地生成。把它当成一類需要管理的 URL 類型,分類、取舍、观察,通常比一次性全部關掉要稳妥。