常见問题

蜘蛛池與URL發現:目标URL带着 utm、fbclid 等跟踪參數,该清理還是照投?

投放蜘蛛池时,很多人直接把带跟踪參數的 URL 扔進入口頁。本文区分内容參數與营销參數,說明搜尋蜘蛛對參數 URL 的常见處理方式,並给出規范化、robots.txt、提交口径上的處理顺序,帮你判断哪些带參地址值得投、哪些應该先清理。

常见問题

蜘蛛池與URL發現:目标URL带着 utm、fbclid 等跟踪參數,该清理還是照投?

投放蜘蛛池时,经常有人直接把後台導出的带參地址扔進入口頁,比如一條網址後面挂着 utm_source、fbclid、spm、ref 之類的一長串參數。這類 URL 能抓到,但值不值得占用抓取频次去抓,是另一個問题。

一、跟踪參數 URL 到底算不算“新頁面”

對服務器来说,带參和不带參是两條不同的地址,會各自返回 200;對搜尋引擎来说,它們希望把這些识別成同一個頁面。识別得准不准,取决于參數類型:

  • 营销參數(utm 系列、fbclid、gclid、spm、from、ref):不改變頁面内容,是典型的重复 URL 来源。
  • 内容參數(id、page、p、cat、keyword、sort):會改變頁面呈現的内容,属于真正不同的頁面。

前者被大規模投放,往往等于给自己制造重复抓取;後者本身就是站点结构的一部分,本来就需要被正常發現。

二、搜尋蜘蛛對參數的預設處理

主流搜尋引擎對常见营销參數有一定识別能力,通常會做归一化處理,把带參 URL 归到主体 URL 上。但這份名單是動態的,自造參數(例如日期或投放渠道拼出来的後缀)不一定在识別范围内。结果通常是:

  • 抓取频次被大量近似頁面占用,真正需要更新的頁面排队更久。
  • 抓取日誌里出現大量參數變体,排查問题时噪声明顯變大。
  • 頁面既没有 canonical、也没有 301 时,同一内容可能以多條 URL 同时存在。

三、投放前的處理顺序

  1. 先做規范化。頁面上用 canonical 指向不带跟踪參數的版本;如果參數纯粹是营销用途,服務端 301 到干净 URL 會更彻底。
  2. 再检查參數是否真的必要。能放到 cookie、埋点脚本或 referrer 里解决的,就不要留在可被抓取的 URL 上。
  3. 投放的 URL 用干净版本。蜘蛛池入口頁和 sitemap 里優先寫不带跟踪參數的地址,让抓取落在真正要被索引的那條 URL 上。
  4. 確認 robots.txt 没有反向誤伤。用 Disallow 屏蔽參數虽然能减少抓取,但也會挡住本该抓取的内容參數;而且被屏蔽的 URL 依然可能留在索引里,只是展示形式受限。屏蔽前先分清參數種類。

四、什么情况下可以直接投带參 URL

  • 參數决定内容:商品篩選、分頁、多語言切換這類,URL 本身就是入口,投放有意义。
  • 參數頁有獨立搜尋需求:比如列表第二頁、第三頁對用戶存在實际價值。
  • 站点暂时無法改動代碼:只能用 canonical 做软约束,此时至少要保證每個參數變体都輸出正确的 canonical。

五、几個容易踩的坑

  • 把參數 URL 和不带參 URL 都塞進入口頁,等于人為放大重复度。
  • 入口頁連結先跳到一個带參地址再二次跳轉,抓取路径變長,中途被放弃的概率也會上升。
  • 只靠 robots.txt 處理參數,却忽略搜尋引擎仍可能從外鏈等渠道得知這條 URL。
判断标准可以很简單:這條 URL 如果被收錄,它能不能獨立满足一次搜尋?能,就照投;不能,就先規范化,再考虑投放。

參數本身不是問题,把參數当成新頁面才是問题。投放前花几分钟区分内容參數和营销參數,通常比事後在抓取日誌里一條條找原因省事得多。