網站收錄

带參數的 URL 被搜到:篩選、排序與跟踪參數怎么收敛收錄

站内篩選、排序、分享連結都會生成带參數的地址,處理不好就會在索引里堆出一批相似頁面。本文先把參數分成跟踪類、视图類和篩選類,再按“先断内鏈、再统一 canonical、無價值组合 noindex、最後才用 robots.txt”的顺序给出收敛办法,並說明怎么核對效果。

網站收錄

带參數的 URL 被搜到:篩選、排序與跟踪參數怎么收敛收錄

站内篩選、排序、分享、跳轉,几乎每個功能都會在 URL 後面挂一串參數。對用戶来说方便,對搜尋引擎来说,却可能把同一個頁面拆成几十上百個地址。如果不做處理,索引里會慢慢堆积一批“長得不一样、内容几乎一样”的頁面。

先把參數分成三類

處理方式不同,前提是先归類。常见參數大致可以分成三種:

  • 跟踪類:utm_source、gclid、spm、from、ref 之類,只记錄来源,不改變頁面内容。
  • 视图與排序類:sort=price、view=grid、list=card,内容主体相同,只是排列或展示方式變了。
  • 篩選類:color=red、size=42、brand=x,可能筛出真正不同的结果集合,也可能组合出成千上萬個地址。

三類參數的共同点是:它們都容易被蜘蛛顺着内鏈抓到,也容易在分享、跳轉、广告投放中被外部連結带進来。

哪些參數頁面值得留在索引里

可以問自己两個問题:去掉參數後,頁面呈現的内容是否真的變了;以及有没有人會去搜這個组合。按這個标准大致能分出三档:

  • 筛出的结果是稳定的子集合,组合數量有限,並且有對應搜尋需求——可以保留,让它正常收錄。
  • 筛完只剩一两個结果,或者属性叠加後组合無穷——通常不值得單獨收錄。
  • 排序、视图、分頁參數——基本都不需要各留一個索引版本。

判断时別只看頁面上有多少條结果,更要看這些组合會不會被用戶主動搜尋,以及蜘蛛是否會反复抓取同一批地址。

按顺序處理:先断内鏈,再谈标簽

1. 内鏈和站点地图不要輸出带參地址

很多站点的參數頁面之所以被抓到,是因為站点自己就在用带參連結做導航。把分類頁、列表頁、文章内鏈统一改成無參地址,能直接掐掉大部分發現路径。這一步成本低,效果也最直接。

2. 用 canonical 指向規范版本

對于跟踪參數和排序视图參數,可以在頁面上把 canonical 指向去掉參數的那個地址。注意 canonical 是提示而不是命令,它需要和自引用一起保持自洽,別出現“A 指向 B、B 又指向 A”的循环。

3. 無收錄價值的组合用 noindex

当某個篩選组合用戶量不大、又没有搜尋需求时,可以给這類頁面加 noindex,让内鏈仍然可用、用戶仍能訪問,但不進索引。前提是頁面本身可以被抓取,标簽才能被讀到。

4. 兜底才考虑 robots.txt

robots.txt 适合屏蔽那些完全不需要被抓、也不需要通過頁面传递信号的路径。它不适合用来處理重复收錄,因為一旦禁止抓取,蜘蛛讀不到頁面上的 canonical 和 noindex。

顺序很重要:如果先用 robots.txt 屏蔽抓取,後面的 canonical 和 noindex 就都失效了,等于把可控的問题變成不可控的問题。

收敛之後怎么核對

  • 用站内搜尋指令加參數關鍵詞,看索引里還剩哪些地址形式。
  • 观察抓取統計中带參 URL 的占比,是否随時間下降。
  • 抽查几個參數頁,確認 canonical 指向無參版本、且頁面能正常渲染。
  • 翻日誌,看蜘蛛是否還在反复抓取同一批參數组合。

两個容易踩的誤区

一是把 canonical 当成即时生效的開關。索引的更新有滞後,改完通常要观察几周再判断,不要隔天看到舊地址還在就以為没生效。二是認為“被收錄了總没坏處”。带參頁面占的是抓取资源,也可能在搜尋结果里和規范頁互相竞争,让用戶看到的版本變得不可控。

收敛參數收錄更像是一次清理,而不是一次設定。先把發現路径收窄,再统一頁面信号,最後才動用屏蔽手段,顺序對了,後續维護會省下不少力气。