很多站点在收錄上的麻烦,不是出在頁面本身,而是出在 URL 上多出来的那串問号參數。同一批商品或文章,因為篩選、排序、来源追踪,被识別成几十上百個地址,抓取配額被摊薄,規范頁也分散到各處,之後再谈收錄就變得很別扭。
先把參數按用途分成几類
不同參數的意图不一样,處理方式也不该一样。動手之前先做一次归類,通常比直接上規則更省事。
- 追踪類:utm_source、gclid、fbclid、ref 之類,只记錄来源,不改變頁面内容。
- 排序類:sort、order、by,只改變展示顺序,内容集合基本一致。
- 篩選類:颜色、價格区間、品牌等,可能组合出大量地址,其中少數组合有真實搜尋需求。
- 分頁與會话類:page、sid、sessionid,属于浏览過程中的狀態。
三類處理手段,各管一段
robots.txt 用来挡抓取
Disallow 只能阻止抓取,不能保證頁面不進索引。如果某個带參數的地址已经被外鏈引用過,屏蔽抓取之後反而可能留下一個拿不到内容、没有摘要的结果。它适合處理确定無價值、也不想再被抓的地址。
canonical 用来表達“同一份内容”
canonical 适合追踪參數、排序參數這類頁面主体完全一致的情况。前提是主版本本身可抓取、可索引,並且站内連結也指向它,否則指向關系容易被忽略。
noindex 與參數處理工具用来做收敛
對确實有内容、但不值得單獨占一個索引位的長尾组合,比如“红色加 XL”這種篩選,可以考虑 noindex,follow,让連結關系還能在頁面之間流動。平台提供的參數處理設定适合整類收敛,但它是信号而不是指令,落地後仍要观察實际效果。
一套可执行的排查顺序
- 從服務器日誌或抓取統計里,拉出一段時間内被抓取次數最多的带參數地址。
- 按上面四類打标,看每一類各占多少抓取比例,先處理占比最大的一類。
- 追踪參數在模板层统一清掉:内鏈、分享按钮、邮件、广告落地頁都不带。
- 排序參數统一 canonical 到預設顺序的版本,並保證預設版本可抓取。
- 篩選參數按有無搜尋需求分组,有量的保留少數组合並给到内鏈入口,没有的收敛掉。
- 改完之後留出一個观察窗口,不要当天再叠新規則,否則分不清是哪一步起的作用。
观察這几個指标
- 抓取請求中带參數地址的比例是否下降。
- 主版本地址的抓取频次和抓取深度是否回升。
- 索引狀態里,同一份内容是否逐渐集中到主版本上。
内鏈是收敛的最後一公里
規則改完,如果站内連結仍然到處带着參數,抓取入口就還是散的。列表頁、面包屑、相關推荐、上一頁下一頁,這些位置的連結最好统一成不带追踪參數的干净地址。這一步做完,前面的設定才有稳定的落点。
參數治理的目标是把抓取和索引集中到真正有價值的地址上,它不承诺頁面一定被收錄,也不代表索引數量會立刻發生變化。
這件事更适合当成長期维護来做:新上线的模板、新加的投放連結,都可能重新带回參數。把它寫進上线检查項,比事後一次性大掃除更省力。