網站收錄

篩選參數和站内搜尋頁被收錄:參數類 URL 的收口核對顺序

列表篩選、排序、站内搜尋、来源追踪等带參數的地址往往數量近乎無限且内容重复,被大量收錄後會稀释站内權重、干扰索引判断。本文按參數分類、價值判断、處理優先級、搜尋頁單獨對待、收口後观察五個步骤,梳理一套可执行的核對顺序。

網站收錄

篩選參數和站内搜尋頁被收錄:參數類 URL 的收口核對顺序

很多站点在检查索引量时會發現,真正带来流量的詳情頁没多少,反而是各種带參數的地址占了大头:列表篩選、排序方式、每頁條數、站内搜尋關鍵詞、来源追踪參數……這些頁面本身不是错誤,問题在于它們數量近乎無限,内容又高度重复。它們被大量收錄後,會稀释站内連結權重,也让日誌和索引报告难以判断真實情况。

第一步:先確認被收錄的是哪一類參數

不要看到查询字符串就立刻動手屏蔽。先抽样,把參數按用途分類,處理方式完全不同。

  • 内容型參數:决定頁面展示哪一批内容,例如分類叠加尺碼、叠加颜色。這類頁面有时确實存在搜尋需求。
  • 展示型參數:排序方式、每頁顯示數量、列表或網格视图。同一批内容的排列组合,通常没有獨立價值。
  • 追踪型參數:投放来源、渠道标识、活動编号。對爬虫和索引而言基本是噪声。
  • 會话型參數:用戶标识、临时令牌、時間戳。這類地址本来就不该出現在可抓取的 HTML 里。

第二步:判断這個參數頁有没有獨立價值

核查方式可以很简單:把參數去掉,看剩下的頁面内容是否几乎一致。如果只是顺序不同、條目相同,那它更像同一個頁面的视图;如果篩選後形成了一批稳定的、有人會主動搜尋的主题,可以考虑保留並優化,而不是一律封杀。

一個實用判断:如果這個地址没有站内入口、也不该出現在 sitemap 里,那它大概率不该被收錄。

第三步:按優先級處理,別一次全上

  1. 先處理會话型參數。让程序在模板輸出連結时就不要拼上這些值,從源头减少可抓取入口。
  2. 追踪參數统一用 canonical 指向無參數版本,站内連結里同步去掉。
  3. 展示型參數用 canonical 或者加 noindex,二選一,不要两種信号混用在同一批 URL 上。
  4. 篩選组合過多的站点,可以限制可被索引的參數组合數量,超出部分统一 noindex。
  5. robots.txt 屏蔽是最後手段。它只阻止抓取,不阻止已收錄的地址繼續留在索引里,而且被屏蔽後 canonical 也無法被發現。
抓取屏蔽和索引移除是两件事。用 Disallow 挡住參數目錄,往往會让已收錄的地址長期停在索引中,因為没有爬虫去讀頁面上的 canonical 和 noindex。

第四步:站内搜尋頁單獨對待

站内搜尋结果頁通常是重复内容的重灾区:關鍵詞無穷多,内容又由站内已有頁面拼成。常见做法是允许用戶使用,但给结果頁加 noindex,同时不要把它們放進 sitemap,也不要在頁面里提供大量指向其它搜尋词的内鏈。如果确實有一部分搜尋词有稳定需求,可以挑選少量做成固定的专题頁。

第五步:收口之後的观察

調整生效需要時間,观察时建议分三個口径看:抓取日誌里參數 URL 的請求占比、索引报告里參數 URL 的數量變化、以及無參數主頁面获得的抓取次數。只要主頁面抓取變多、參數 URL 請求變少,方向就是對的。不要只盯着索引總數下降就判断出問题,先確認减少的是不是那些本来就该被排除的地址。