站点运营

站点运营:篩選與分頁參數自查,別让组合地址吃掉抓取配額

篩選、排序、跟踪參數叠加後,一個栏目可能生成成千上萬條地址,既稀释内容頁權重,也占用抓取资源。本文梳理參數地址的常见来源、索引現状的自查方法,以及 robots.txt、noindex、canonical 與分頁處理的适用邊界,帮助站点把抓取资源留给真正需要更新的頁面。

站点运营

站点运营:篩選與分頁參數自查,別让组合地址吃掉抓取配額

很多站点在改版或上线篩選功能之後,地址數量會突然膨胀。原本几百個内容頁,几周内變成几萬甚至几十萬條 URL,其中大部分是排序、篩選、跟踪參數拼出来的组合。這些地址内容高度相似,却各自占用抓取队列,真正需要更新的頁面反而排不上。

參數地址為什么會失控

常见来源有三類:

  • 排序與视图參數:如 sort=price、view=list,同一批内容換個顺序就是一個新地址。
  • 篩選组合:颜色、尺寸、價格区間、品牌多選,组合數量是乘法關系,几十個選項就能拼出上萬條 URL。
  • 跟踪與會话參數:utm_、from=、ref=、sessionid 等,多出現在外鏈、广告和站内跳轉里。

除此之外,分頁參數也很容易出問题。列表翻到第 50 頁、第 200 頁,如果每一頁都允许抓取且没有上限,同样會消耗大量配額。

先做一轮自查

確認哪些參數地址已经進了索引

用 site: 加參數關鍵詞抽查,或者在站点地图與訪問日誌里統計带問号的 URL 比例。如果占比超過内容頁本身,基本可以判断參數已经失控。

区分有需求與纯组合

不是所有篩選頁都该被拦。像“某品牌 某型号”這類有明确搜尋需求的组合,可以保留為獨立頁面;而“颜色A + 尺寸B + 排序方式C”這種很少有人主動搜的组合,更适合收敛。

检查跟踪參數是否被当成獨立地址

站内連結、分享按钮、邮件里的連結如果随手带 utm 參數,蜘蛛顺着爬就會不断生成副本。

几種處理方式的区別

  • robots.txt 屏蔽:能阻止抓取,但無法阻止已收錄的地址繼續出現在结果里,而且被屏蔽後搜尋引擎也讀不到頁面上的 noindex。
  • noindex 标簽:需要頁面能被正常抓取才生效,适合内容真實存在但不想被索引的篩選頁。
  • canonical 指向:把參數頁指向對應的主列表頁,适合内容重复度极高的场景,但它只是一個提示信号。
  • 連結控制:站内尽量不生成無意义的參數連結,從源头减少地址數量,通常比事後處理更省事。
屏蔽、noindex、canonical 解决的是不同問题,混用容易互相打架。比如既在 robots.txt 里 Disallow,又指望 noindex 生效,往往是白忙一场。

分頁怎么處理

分頁地址通常是規范内容的一部分,不建议一律屏蔽。更常见的做法是:

  1. 分頁頁 canonical 指向自身,而不是全部指向第一頁,否則第一頁之外的列表内容很难被單獨评估。
  2. 给分頁設定合理上限,或者把深层翻頁改成“加载更多”,同时保證有一個可抓取的主連結通道。
  3. 列表頁本身保持稳定,避免每翻一頁就更換排序參數。

驗證與後續观察

調整之後,對比調整前後的抓取日誌:带參數的請求比例是否下降,内容頁的抓取频次是否上升。同时留意覆盖率报告里“已排除”類別的變化,確認没有被誤伤的頁面。參數治理不是一次性工作,新增功能、投放活動、模板改版都可能重新引入參數,建议把它寫進上线检查項里。