網站收錄

带參數的 URL 被大量收錄:篩選、排序與跟踪參數的收口顺序

站内索引里常混進一批只差几個字符的地址:utm 分享連結、排序篩選组合、會话參數。本文按參數類型分步梳理,先確認哪些带參地址确實進了索引,再判断该保留還是收敛,最後從站内連結、服務端跳轉和 canonical 三條线收口,並說明复查时该看什么指标。

網站收錄

带參數的 URL 被大量收錄:篩選、排序與跟踪參數的收口顺序

查收錄量时,很多站点會發現索引里多出一批只差几個字符的地址:带 utm 的分享連結、带排序參數的列表頁、带篩選條件的商品頁。它們和無參版本的内容几乎一样,却各自占着一個索引位。處理這類問题,關键不是一刀切屏蔽問号,而是先把參數分好類,再按顺序收口。

第一步:確認被收錄的是哪一類參數

同样是問号後面的内容,来源和意图差別很大。可以把索引里多出来的地址拉出来,對照它的入口来源,大致归成几類:

  • 跟踪類:utm_source、gclid、fbclid、spm、from 等,来自投放、分享和站外跳轉,頁面内容與無參版完全相同。
  • 篩選與排序類:颜色、價格区間、排序方式。少數组合有獨立检索需求,大多數只是用戶随手点出来的。
  • 分頁與會话類:page、p、sid、sessionid 等,多半由程序生成,组合數量可能非常大。
  • 功能類:带 token、预览、打印、導出參數的地址,通常不该出現在公開索引里。

找這些地址时,可以同时用站内搜尋语法抽查、站長後台的頁面报告按 URL 關鍵詞篩選,以及看服務器日誌里被高频抓取的带參路径。三個来源交叉着看,比只看一個數字可靠。

第二步:判断哪些该留、哪些该收

不是所有带參地址都要清掉。判断的依據是:這個地址有没有獨立于無參版本的检索價值。

  • 跟踪類參數没有獨立價值,统一收敛到無參地址。
  • 篩選類先看資料:有搜尋量的少數组合可以保留,單獨優化标题與描述;没有搜尋量的组合再考虑控制抓取。
  • 功能類地址建议直接禁止抓取,或返回 404、410,不让它們進入索引流程。
noindex 需要頁面被實际抓取才會生效。如果同时用 robots.txt 屏蔽该路径,noindex 就永遠讀不到,两個手段選一個,不要叠在一起用。

第三步:按内鏈、跳轉、声明三條线收口

  1. 先改站内:導航、文章内鏈、分享按钮、广告素材里去掉跟踪參數,這是源头。
  2. 再做跳轉:對確認無價值的跟踪參數,服務端 301 到無參版本。白名單式處理,只跳确定的參數名,不要用正則匹配所有問号。
  3. 补 canonical:保留但不想重复收錄的带參頁面,canonical 指向無參版本,並保證两邊正文一致。
  4. 限制组合爆炸:篩選參數的可選值要有上限,不可共存的參數不要同时出現,避免生成大量空结果地址。
  5. 站内搜尋结果頁不要開放抓取,這類頁面最容易成批進索引。

收口之後看什么

改完不要立刻下结论。索引里的舊地址會存在一段時間,重新抓取和計算都需要周期。建议按两周左右的节奏复查一次覆盖率报告,观察带參地址的數量趋势,同时確認無參版本是否稳定。

如果带參地址在减少,而正文頁的抓取量没有明顯變化,說明這次收口基本没伤到有效頁面;如果连正文頁的抓取也一起掉了,回头检查 robots.txt 是不是寫得太宽。

最後两点提醒:參數處理是長期维護的事,新增投放、新版篩選功能都可能再带出一批地址;另外別把带參地址消失当成唯一目标,真正要盯的是有效頁面能不能被正常抓取和展示。