網站收錄

带參數的 URL 该不该收錄:追踪、排序、篩選參數的取舍顺序

带參數的 URL 常被系統当成多個頁面,既摊薄抓取预算,也让規范頁分散。本文按追踪、排序、篩選、分頁四類參數梳理處理顺序,說明 robots.txt、canonical、noindex 各自能管什么,並给出一套從日誌統計到观察窗口的排查步骤。

網站收錄

带參數的 URL 该不该收錄:追踪、排序、篩選參數的取舍顺序

很多站点在收錄上的麻烦,不是出在頁面本身,而是出在 URL 上多出来的那串問号參數。同一批商品或文章,因為篩選、排序、来源追踪,被识別成几十上百個地址,抓取配額被摊薄,規范頁也分散到各處,之後再谈收錄就變得很別扭。

先把參數按用途分成几類

不同參數的意图不一样,處理方式也不该一样。動手之前先做一次归類,通常比直接上規則更省事。

  • 追踪類:utm_source、gclid、fbclid、ref 之類,只记錄来源,不改變頁面内容。
  • 排序類:sort、order、by,只改變展示顺序,内容集合基本一致。
  • 篩選類:颜色、價格区間、品牌等,可能组合出大量地址,其中少數组合有真實搜尋需求。
  • 分頁與會话類:page、sid、sessionid,属于浏览過程中的狀態。

三類處理手段,各管一段

robots.txt 用来挡抓取

Disallow 只能阻止抓取,不能保證頁面不進索引。如果某個带參數的地址已经被外鏈引用過,屏蔽抓取之後反而可能留下一個拿不到内容、没有摘要的结果。它适合處理确定無價值、也不想再被抓的地址。

canonical 用来表達“同一份内容”

canonical 适合追踪參數、排序參數這類頁面主体完全一致的情况。前提是主版本本身可抓取、可索引,並且站内連結也指向它,否則指向關系容易被忽略。

noindex 與參數處理工具用来做收敛

對确實有内容、但不值得單獨占一個索引位的長尾组合,比如“红色加 XL”這種篩選,可以考虑 noindex,follow,让連結關系還能在頁面之間流動。平台提供的參數處理設定适合整類收敛,但它是信号而不是指令,落地後仍要观察實际效果。

一套可执行的排查顺序

  1. 從服務器日誌或抓取統計里,拉出一段時間内被抓取次數最多的带參數地址。
  2. 按上面四類打标,看每一類各占多少抓取比例,先處理占比最大的一類。
  3. 追踪參數在模板层统一清掉:内鏈、分享按钮、邮件、广告落地頁都不带。
  4. 排序參數统一 canonical 到預設顺序的版本,並保證預設版本可抓取。
  5. 篩選參數按有無搜尋需求分组,有量的保留少數组合並给到内鏈入口,没有的收敛掉。
  6. 改完之後留出一個观察窗口,不要当天再叠新規則,否則分不清是哪一步起的作用。

观察這几個指标

  • 抓取請求中带參數地址的比例是否下降。
  • 主版本地址的抓取频次和抓取深度是否回升。
  • 索引狀態里,同一份内容是否逐渐集中到主版本上。

内鏈是收敛的最後一公里

規則改完,如果站内連結仍然到處带着參數,抓取入口就還是散的。列表頁、面包屑、相關推荐、上一頁下一頁,這些位置的連結最好统一成不带追踪參數的干净地址。這一步做完,前面的設定才有稳定的落点。

參數治理的目标是把抓取和索引集中到真正有價值的地址上,它不承诺頁面一定被收錄,也不代表索引數量會立刻發生變化。

這件事更适合当成長期维護来做:新上线的模板、新加的投放連結,都可能重新带回參數。把它寫進上线检查項,比事後一次性大掃除更省力。